返回
Natural vs programming language in LLM knowledge graph construction
DOI:10.1016/j.ipm.2025.104195.png)
摘要
En 中文
知识图谱构建(KGC)的研究近期展现出巨大潜力,这也要归功于利用大型语言模型(LLM)从原始文本中自动提取结构化信息的应用。然而,大多数研究依赖商业闭源的LLM,阻碍了可重复性和可及性。我们探索使用较小、开源权重的LLM进行KGC,并调查它们是否能够超越依赖更大闭源模型的系统所获得的结果。具体而言,我们关注CodeKGC,一个基于GPT-3.5的提示框架。我们选择多种模型,这些模型要么主要在自然语言上预训练,要么在代码上预训练,并在三个用于信息提取的数据集上进行微调。我们使用以自然语言格式或类似Python脚本格式编写的提示进行微调。此外,我们还可选地使用包含思维链(chain-of-thought)部分的提示训练模型。微调后,编码提示与自然语言提示的选择对性能影响有限,而思维链训练大多导致性能下降。此外,我们表明,在经过相同量级的训练后,一个LLM可能被小得多的版本在任务上超越。我们发现,经过微调后,所选的轻量级LLM普遍比大得多的CodeKGC高出15-20个绝对F1点。结果表明,可以使用更小且开源的模型开发出当前最先进的KGC系统,从而增强研究透明度,降低计算需求,并减少对第三方API的依赖。代码:https://github.com/TinfFoil/natcode-llm-kgc
Keyword:
Knowledge graph construction
large language models
Code language models
Information extraction
期刊
I
IF:
6.9
论文数:
5.2K
被引数:
1.4W
机构
引用论文
An Effective Scholarly Search by Combining Inverted Indices and Structured Search With Citation Networks Analysis
IEEE ACCESS
IF3.6

