返回
Benchmarking Large Language Models for Embedded Systems Programming in Microcontroller-Driven IoT Applications
DOI:10.3390/fi18020094.png)
摘要
En 中文
大型语言模型(LLMs)在软件开发的自动代码生成方面显示出巨大潜力,但它们在嵌入式系统编程中的有效性——需要理解软件逻辑和硬件约束——尚未得到充分研究。现有的评估框架未能全面涵盖实际微控制器开发场景中的真实物联网(IoT)项目。本研究系统地评估了27个前沿LLMs在八个复杂度递增的嵌入式系统场景中的表现,从基本的传感器读取到完整的云数据库集成与可视化仪表板。我们使用ESP32微控制器与环境及运动传感器,采用包含四个加权标准的层次分析法(AHP):功能性、指令、输出和创造性,并由两位专家评审独立评估。表现最佳的模型为Claude Sonnet 4.5、Claude Opus 4.1和Gemini 2.5 Pro,得分在0.984至0.910之间。随着复杂度增加,性能下降:19至23个模型为简单应用生成了可编译代码,但仅有3至5个模型为涉及Grafana和云数据库的复杂场景提供了功能性解决方案。最常见的失败原因是虚构不存在的库或错误的API使用,其中功能性是主要障碍,而指令遵循质量是区分合格模型的关键因素。这些发现为嵌入式开发者提供了LLM选择的实证指导,并指出了零样本提示在硬件依赖型IoT开发中的局限性。
Keyword:
embedded system
ESP32
IoT
LLM
microcontroller
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
3.6
论文数:
1.2K
被引数:
6.5K
机构
引用论文
CreativEval: Evaluating Creativity of LLM-Based Hardware Code GenerationCreativEval:评估LLM基础硬件代码生成的创造性
The Programmer’s Assistant: Conversational Interaction with a Large Language Model for Software Development程序员的助手: 与软件开发的大型语言模型进行会话交互
CWEval: Outcome-driven Evaluation on Functionality and Security of LLM Code GenerationCWEval:基于结果驱动的LLM代码生成功能性与安全性评估
Exploring and Characterizing Large Language Models for Embedded System Development and Debugging探索和表征用于嵌入式系统开发与调试的大型语言模型
Rethinking Software Testing for Modern DevelopmentSaxena, A. 重新思考现代开发中的软件测试. Computer 2025, 58, 49–58. [Google Scholar] [CrossRef]
Computer
IF0

