返回
Benchmarking LLM-based agents for single-cell omics analysis
DOI:10.1186/s13059-026-03998-z.png)
摘要
En 中文
单细胞组学数据的激增暴露了传统手动定义的分析工作流程的局限性。AI智能体提供了一种范式转变,能够实现自适应规划、可执行代码生成、可追溯的决策和实时知识融合。然而,缺乏全面的基准测试严重阻碍了进展。我们介绍了一种新型基准评估系统,以严格评估智能体在单细胞组学分析中的能力。该系统包括:一个兼容多种智能体框架和LLM的统一平台;多维指标评估认知程序合成、协作、执行效率、生物信息学知识整合和任务完成质量;以及50个涵盖多组学、物种和测序技术的真实世界单细胞组学分析任务。我们的评估显示,Grok3-beta在测试的智能体框架中达到了最先进的性能。多智能体框架通过专门的角色划分显著提升了协作和执行效率,优于单智能体方法。智能体能力的归因分析表明,高质量的代码生成对任务成功至关重要,自省具有最显著的整体影响,其次是检索增强生成(RAG)和规划。这项工作突出了代码生成、长上下文处理和上下文感知知识检索方面的持续挑战,为计算生物学中开发稳健的AI智能体提供了关键的实证基础和最佳实践。
Keyword:
Benchmarking evaluation system
LLM-based agents
Single-cell omics analysis
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
G
IF:
9.4
论文数:
6.4K
被引数:
7.3W
机构
引用论文
A clustering-independent method for finding differentially expressed genes in single-cell transcriptome data
NATURE COMMUNICATIONS
IF15.7
BioCoder: a benchmark for bioinformatics code generation with large language modelsBioCoder:一个用于生物信息学代码生成的大语言模型基准
PeakVI: A deep generative model for single-cell chromatin accessibility analysis
CELL REPORTS METHODS
IF4.5
From Louvain to Leiden: guaranteeing well-connected communities从鲁汶到莱顿: 保证良好连接的社区
SCIENTIFIC REPORTS
IF3.9

