返回
Aligning Small Language Models for Programming Feedback
DOI:10.1145/3770762.3772539.png)
摘要
En 中文
为编程学习的学生提供及时且可操作的反绩至关重要。尽管大型语言模型(LLMs)正越来越多地用于自动化这一过程,但它们的部署成本高昂,并引发隐私和机构控制的担忧。小型语言模型(SLMs)提供了一种有前景的替代方案:它们可以本地运行,并能更灵活地集成到教育平台中。然而,它们的开箱即用性能通常较差,需要针对性训练才能在课堂中有效。在本文中,我们探讨了经过训练的3B参数SLM,在基于评分标准的提示和结合监督学习与偏好学习的管道指导下,能否生成接近大型模型质量的诊断反馈。我们在大规模在线编程课程中部署该模型,并将其反馈与其基础模型、微调变体、Llama-3.1-8B以及GPT-4.1进行比较,使用53名助教的人类评分和自动化的LLM作为裁判的分析。我们的结果表明,精心训练可将SLM与LLM在关键指标上的反馈质量差距从超过80个百分点缩小到仅10个百分点。训练后的SLM很少产生虚假错误,经常被教育者评为有帮助,并且偶尔会遗漏学生代码中的问题。这些发现表明,小型模型可以在大规模教育环境中作为实用且可扩展的针对性反馈解决方案,而LLMs可能仍需用于更全面的诊断反馈。
Keyword:
programming feedback
large language models
small language models
generative AI
open-weight
automatic feedback

