arrow
返回

Natural vs programming language in LLM knowledge graph construction

delete2025-06-06
delete0
delete
OA
AI
P
Paolo Gajo
A
Alberto Barrón‐Cedeño *
DOI:10.1016/j.ipm.2025.104195delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
知识图谱构建(KGC)的研究近期展现出巨大潜力,这也要归功于利用大型语言模型(LLM)从原始文本中自动提取结构化信息的应用。然而,大多数研究依赖商业闭源的LLM,阻碍了可重复性和可及性。我们探索使用较小、开源权重的LLM进行KGC,并调查它们是否能够超越依赖更大闭源模型的系统所获得的结果。具体而言,我们关注CodeKGC,一个基于GPT-3.5的提示框架。我们选择多种模型,这些模型要么主要在自然语言上预训练,要么在代码上预训练,并在三个用于信息提取的数据集上进行微调。我们使用以自然语言格式或类似Python脚本格式编写的提示进行微调。此外,我们还可选地使用包含思维链(chain-of-thought)部分的提示训练模型。微调后,编码提示与自然语言提示的选择对性能影响有限,而思维链训练大多导致性能下降。此外,我们表明,在经过相同量级的训练后,一个LLM可能被小得多的版本在任务上超越。我们发现,经过微调后,所选的轻量级LLM普遍比大得多的CodeKGC高出15-20个绝对F1点。结果表明,可以使用更小且开源的模型开发出当前最先进的KGC系统,从而增强研究透明度,降低计算需求,并减少对第三方API的依赖。代码:https://github.com/TinfFoil/natcode-llm-kgc
Keyword:
Knowledge graph construction
large language models
Code language models
Information extraction

期刊

I
Information Processing and Management
IF:
6.9
论文数:
5.2K
被引数:
1.4W

机构

U
Univ Bologna
学者数:
1.7K
论文数: 882
被引数: 300
引用论文

引用论文

Differentiable Graph Module (DGM) for Graph Convolutional Networks
err2023-02-01
err0
errOAAI
errAnees Kazi; Luca Cosmo; Seyed-Ahmad Ahmadi; Nassir Navab; Michael M. Bronstein
err分享
err收藏
Long Short-Term Memory长短期记忆
err1997-11-01
err0
PREAI
errSepp Hochreiter; Jürgen Schmidhuber
err分享
err收藏
Resource description framework
err2001-07-01
err0
PREAI
errK. Selçuk Candan; Huan Liu; Reshma Suvarna
err分享
err收藏
An Effective Scholarly Search by Combining Inverted Indices and Structured Search With Citation Networks Analysis
err2021-01-01
err15
errOAAI
errKhalid, Shah; Wu, Shengli; Wahid, Abdul; Alam, Aftab; Ullah, Irfan
err分享
err收藏
学者 查看更多内容