arrow
返回

Biomedical knowledge graph-optimized prompt generation for large language models

delete2024-09-17
delete0
delete
OA
AI
DOI:10.1093/bioinformatics/btae560delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
摘要 研究动机 大型语言模型(LLMs)正以前所未有的速度被采用,但在知识密集型领域(如生物医学)仍面临挑战。预训练和领域特定的微调等方法会增加巨大的计算开销,并需要进一步的领域专业知识。本文通过利用大规模生物医学知识图谱(SPOKE)与Llama-2-13b、GPT-3.5-Turbo和GPT-4等LLMs,介绍了一种基于知识图谱的检索增强生成(KG-RAG)框架,该框架经过令牌优化且具有鲁棒性,用于生成基于既定知识的具有意义性的生物医学文本。 结果 与现有的知识图谱RAG技术相比,所提出的方法利用最少的图模式进行上下文提取,并使用嵌入方法进行上下文修剪。这种上下文提取的优化在不影响准确性的情况下,将令牌消耗减少了超过50%,从而在专有LLMs上实现了一种低成本且鲁棒的RAG实现。KG-RAG通过生成基于既定知识的响应,始终提升了LLMs在多样化生物医学提示下的性能,并附带准确的来源和统计证据(如可用)来支持其主张。在人工整理的数据集(如生物医学真假判断和选择题(MCQ))上的进一步基准测试显示,在具有挑战性的MCQ数据集上,Llama-2模型的性能提升了惊人的71%,证明了该框架能够赋能参数较少的开源模型以应对领域特定问题。此外,KG-RAG还提升了专有GPT模型(如GPT-3.5和GPT-4)的性能。总之,所提出的框架以令牌优化的方式结合了知识图谱和LLMs的显式和隐式知识,从而以低成本的方式增强了通用LLMs对领域特定问题的适应性。 可用性与实现 SPOKE知识图谱可通过https://spoke.rbvi.ucsf.edu/neighborhood.html访问。它也可以通过REST-API(https://spoke.rbvi.ucsf.edu/swagger/)访问。KG-RAG代码已发布在https://github.com/BaranziniLab/KG_RAG。本研究中使用的生物医学基准数据集已通过同一GitHub仓库向研究界开放。

期刊

暂无期刊信息

机构

暂无机构信息
引用论文

引用论文

暂无论文信息