arrow
返回

BioCoder: a benchmark for bioinformatics code generation with large language models

delete2024-06-28
delete0
delete
OA
AI
DOI:10.1093/bioinformatics/btae230delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
摘要 摘要 预训练的大型语言模型(LLMs)显著提升了代码生成能力。随着这些模型的规模扩大,对其输出能够处理更复杂任务以及针对特定领域进行适当专业化的需求日益增加。本研究以生物信息学为目标,因为该学科需要大量的领域知识、算法和数据操作。我们提出了BioCoder,一个用于评估LLMs在生成生物信息学特定代码能力的基准。BioCoder覆盖了该领域的多个方面,包括跨文件依赖、类声明和全局变量。它整合了从GitHub提取的1026个Python函数和1243个Java方法,以及来自Rosalind项目的253个示例,所有内容均与生物信息学相关。通过主题建模,我们展示了所包含代码的整体覆盖面代表了生物信息学计算的完整谱系。BioCoder包含一个模糊测试框架用于评估。我们已将其应用于评估多种模型,包括InCoder、CodeGen、CodeGen2、SantaCoder、StarCoder、StarCoder+、InstructCodeT5+、GPT-3.5和GPT-4。此外,我们对一个模型(StarCoder)进行了微调,证明我们的训练数据集能够提升在测试基准上的表现(在特定提示配置下Pass@K指标提升超过15%,且始终超过3%)。结果表明成功模型的关键特征有两个:(i) 成功的模型能够容纳长提示(超过2600个token),包含完整上下文,包括功能依赖;(ii) 它们具备生物信息学领域的特定知识,而不仅仅是通用编码能力。这一点从GPT-3.5/4相较于小型模型在基准测试中的性能提升(50%对比最高25%)中显而易见。 可用性与实现 所有数据集、基准测试、Docker镜像和测试脚本均可通过以下网址获取:https://github.com/gersteinlab/biocoder 和 https://biocoder-benchmark.github.io/。

期刊

暂无期刊信息

机构

暂无机构信息
引用论文

引用论文

暂无论文信息