arrow
返回

Evaluating Large Language Models for Real-World Engineering Tasks

delete2026-01-01
delete0
PRE
AI
R
René Heesch *
S
Sebastian Eilermann
A
Alexander Windmann
A
Alexander Diedrich
O
Oliver Niggemann
DOI:10.1007/978-981-95-4969-6_5delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大型语言模型(LLMs)不仅对日常活动具有变革性,也对工程任务具有变革性。然而,当前对工程领域LLMs的评估存在两个关键缺陷:(i)依赖简化的用例,这些用例通常改编自考试材料,其中正确性易于验证;(ii)使用临时拼凑的场景,这些场景未能充分捕捉关键的工程能力。因此,LLMs在复杂、真实工程问题上的评估在很大程度上仍未被探索。本文通过引入一个包含78个问题的精选数据库来弥补这一差距,这些问题源于真实的、面向生产的工程场景,并系统地设计为涵盖核心能力,如预测和诊断。使用此数据集,我们评估了四种前沿LLMs,包括基于云和本地托管的实例,以系统地研究它们在复杂工程任务上的表现。结果表明,LLMs在基本的时间和结构推理方面表现出优势,但在抽象推理、形式建模和上下文敏感的工程逻辑方面存在显著困难。
Keyword:
LLM
Engineering
Benchmarking

期刊

A
AI 2025: ADVANCES IN ARTIFICIAL INTELLIGENCE, PT I
IF:
0
论文数:
32
被引数:
0

机构

H
Helmut Schmidt University
学者数:
894
论文数: 747
被引数: 797
引用论文

引用论文

Long Short-Term Memory长短期记忆
err1997-11-01
err0
PREAI
errSepp Hochreiter; Jürgen Schmidhuber
err分享
err收藏
Time Series Forecasting with LLMs: Understanding and Enhancing Model Capabilities基于LLMs的时间序列预测:理解并提升模型能力
err2025-01-29
err0
PREAI
errHua Tang; Chong Zhang; Mingyu Jin; Qinkai Yu; Zhenting Wang; Xiaobo Jin; Yongfeng Zhang; Mengnan Du
err分享
err收藏
err分享
err收藏
Learning Physical Concepts in CPS: A Case Study with a Three-Tank System
err2022-01-01
err0
errOAAI
errHenrik Steude; Alexander Windmann; Oliver Niggemann
err分享
err收藏
学者 查看更多内容