返回
RefactorCoderQA: Benchmarking LLMs for Multi-Domain Coding Question Solutions in Cloud and Edge Deployment
DOI:10.1109/tsc.2026.3717248.png)
摘要
En 中文
为优化大型语言模型(LLMs)的推理和问题解决能力,我们提出了一种受云边协同架构启发的结构化多智能体提示框架。该框架由三个专业化智能体组成:GuideLLM,提供方法论指导;SolverLLM,生成代码解决方案;JudgeLLM,自动评估解决方案的正确性和质量。为评估并展示该架构在实际场景中的有效性,我们引入了RefactorCoderQA,一个综合基准,旨在评估和提升LLMs在多领域编码任务中的表现。受现有基准局限性的启发,RefactorCoderQA系统地涵盖了包括软件工程、数据科学、机器学习和自然语言处理在内的多个技术领域,使用来自Stack Overflow的真实编码挑战。我们提出了RefactorCoder-MoE,一个基于DeepSeek-Coder-7B-Instruct的微调专家混合(MoE)代码语言模型,采用QLoRA适应RefactorCoderQA基准,用于领域特定的编码问答。大量实验表明,RefactorCoder-MoE表现出强而有力的竞争性能,显著优于所有评估的开源和商业基线,整体准确率达76.84%。
Keyword:
Large Language Models
Code Generation
Multi-Agent Framework
Benchmarking
Automated Evaluation
期刊
IF:
5.8
论文数:
2.2K
被引数:
6.5K
机构
引用论文
暂无论文信息

