返回
Automating Geospatial Vision Tasks with a Large Language Model Agent
DOI:10.1007/978-3-662-72243-5_13.png)
摘要
En 中文
大型语言模型(LLMs)在自动化数据科学任务的代码生成方面显示出潜力,但在复杂任务序列中(尤其是在地理空间视觉任务中)仍面临挑战。这些困难源于在管理逐步依赖关系、将多样化数据源与空间约束对齐以及准确应用各种地理空间库方面的挑战,通常会导致逻辑错误或幻觉。为解决这些局限性,我们介绍了GeoAgent,一个交互式框架,旨在使LLMs能够有效自动化地理空间视觉任务。GeoAgent在一个蒙特卡洛树搜索框架内集成了代码解释器、静态分析和检索生成,创建了一个针对地理空间数据处理工作流的强大解决方案。我们引入了一个新基准来评估GeoAgent在单轮和多轮任务上的性能,包括跨多个Python库的地理空间数据获取、分析和可视化。我们的实验表明,GeoAgent在函数调用准确性、任务通过率和任务完成方面显著优于基线LLMs,标志着在自动化地理空间视觉任务方面取得了重大进展,并为LLM驱动的地理空间数据分析设定了新标准。
Keyword:
Large Language Model
Agent
Geospatial
Data Analysis
期刊
机构
引用论文
Remote Sensing ChatGPT: Solving Remote Sensing Tasks with ChatGPT and Visual Models遥感ChatGPT:使用ChatGPT和视觉模型解决遥感任务
“Exploring and Evaluating Hallucinations in LLM-Powered Code Generation,”“探索和评估LLM-Powered代码生成中的幻觉现象,”
RS-CLIP: Zero shot remote sensing scene classification via contrastive vision-language supervisionRs-clip: 通过对比视觉语言监督进行零拍遥感场景分类

