arrow
返回

A component-level evaluation framework for diagnosing LLM errors in optimization modelling

delete2026-05-20
delete0
PRE
AI
D
Dania Refai *
M
Moataz Ahmed
DOI:10.1016/j.neucom.2026.133981delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大型语言模型(LLMs)越来越多地用于将自然语言描述转化为数学优化模型。当前的评价方法通常将模型作为一个整体,依赖诸如解的准确性或运行时间等粗略指标,这些指标掩盖了结构或数值错误。本研究提出了一种全面的、基于组件的评价框架,用于评估LLM生成的优化模型。除了传统的最优性差距外,该框架引入了决策变量和约束的精确度与召回率、约束和目标函数的均方根误差(Cons-RMSE和Obj-RMSE),以及基于标记使用和延迟的效率指标。我们在六种提示策略下,对GPT-5、LLaMA 3.1 Instruct和DeepSeek Math在复杂度各异的优化问题上进行了评估。结果表明,GPT-5在各项测试中均优于其他模型,而思维链、自一致性提示和模块化提示被证明最为有效。分析显示,求解器性能主要取决于高约束召回率和低Cons-RMSE,这两者共同确保了结构正确性和解的可靠性。约束精确度和决策变量指标的作用次之,而简洁的输出则能提高计算效率。这些发现提出了自然语言到优化建模的三个原则:(i) 完整的约束覆盖可防止违反;(ii) 最小化Cons-RMSE可确保求解器层面的准确性;(iii) 简洁的输出可提高计算效率。所提出的框架为优化建模中LLM的细粒度、诊断性评价奠定了基础。
Keyword:
LLM evaluation
optimization modelling
constraint recall
Cons-RMSE
computational efficiency

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

K
KFUPM
学者数:
191
论文数: 80
被引数: 4
引用论文

引用论文

暂无论文信息