返回
Automating Plan Evaluation Using Agentic Large Language Models
DOI:10.1177/0739456x251372082.png)
摘要
En 中文
人工计划评估面临可靠性和可扩展性挑战。本研究通过多智能体方法以及/或检索增强生成(RAG)技术,将人类评估与大型语言模型(LLM)进行基准比较,以自动化复杂内容分析任务。我们发现,LLM通常与人类表现相当,大多数错误源于过度推断和有限的领域知识。多智能体方法显著提升了LLM的性能,将常见的机器错误减少了50%以上。将此类LLM工具与人工监督相结合,很可能会成为内容分析的新常态,本研究展示了如何利用人工智能(AI)的效率与精确度,同时结合人类的情境理解能力和领域专长。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
2.5
论文数:
177
被引数:
3.3K
机构
暂无机构信息
引用论文
Measuring and Reporting Intercoder Reliability in Plan Quality Evaluation Research计划质量评估研究中编码器间可靠性的测量和报告
A value of civic voices for smart city: A big data analysis of civic queries posed by Seoul citizens
CITIES
IF6.6
The rise of AI urbanism in post-smart cities: A critical commentary on urban artificial intelligence人工智能城市化在后智能城市的兴起: 对城市人工智能的批判性评论
URBAN STUDIES
IF4.1

