返回
Evaluating Large Language Models for Real-World Engineering Tasks
DOI:10.1007/978-981-95-4969-6_5.png)
摘要
En 中文
大型语言模型(LLMs)不仅对日常活动具有变革性,也对工程任务具有变革性。然而,当前对工程领域LLMs的评估存在两个关键缺陷:(i)依赖简化的用例,这些用例通常改编自考试材料,其中正确性易于验证;(ii)使用临时拼凑的场景,这些场景未能充分捕捉关键的工程能力。因此,LLMs在复杂、真实工程问题上的评估在很大程度上仍未被探索。本文通过引入一个包含78个问题的精选数据库来弥补这一差距,这些问题源于真实的、面向生产的工程场景,并系统地设计为涵盖核心能力,如预测和诊断。使用此数据集,我们评估了四种前沿LLMs,包括基于云和本地托管的实例,以系统地研究它们在复杂工程任务上的表现。结果表明,LLMs在基本的时间和结构推理方面表现出优势,但在抽象推理、形式建模和上下文敏感的工程逻辑方面存在显著困难。
Keyword:
LLM
Engineering
Benchmarking
期刊
A
IF:
0
论文数:
32
被引数:
0
机构
引用论文
Toward autocorrection of chemical process flowsheets using large language models基于大型语言模型实现化工流程图的自动纠错
Time Series Forecasting with LLMs: Understanding and Enhancing Model Capabilities基于LLMs的时间序列预测:理解并提升模型能力

