arrow
返回

A Framework for Assessing LLM Consistency in Knowledge Engineering

delete2026-09-09
delete0
PRE
AI
M
Mohammad Javad Saeedizade
R
Reham Alharbi
H
Hamed Babaei Giglou
A
Anna Sofia Lippolis
E
Eva Blomqvist
V
Valentina Tamma
F
Floriana Grasso
T
Terry R. Payne
J
Jennifer D’Souza
S
Sören Auer
A
Andrea Giovanni Nuzzolese
R
Robin Keskisärkkä
Z
Zebah Valeyil
DOI:10.1177/22104968261479512delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
一致性,即系统、过程或其结果在重复相同或不同条件下产生相似结果的程度,是知识工程(KE)中的关键问题。随着大型语言模型(LLMs)在各项任务中日益受到依赖,这一问题尤为突出。本文介绍了CoLLM框架,该框架通过三种测试来评估系统或过程在基于LLMs的KE任务中是否产生一致结果:(i)《LLM重复性测试》,用于评估现有研究中LLMs的随机性或非确定性水平;(ii)《LLM更新影响测试》,用于检验LLMs更新对结果的影响;(iii)《LLM替换测试》,用于探索使用替代LLMs执行相同研究的效果。通过来自五个不同最新研究的59项不同实验,并利用多种LLMs和数据集,我们研究了结果的一致性,以实证验证每项研究的原始发现的可靠性。我们的调查表明,在大多数情况下(81.4%),尽管个体输出存在一些变化,但仍可观察到与原始研究一致的行为。此外,在某些情况下,更改LLMs的选择可以导致不同指标上的一致性改进。这些结果表明,所提出的框架在评估基于LLMs的KE任务的一致性方面具有可行性。

期刊

Semantic Web 封面图
Semantic Web
IF:
2.9
论文数:
607
被引数:
1.6K

机构

L
Linkoping University
学者数:
1.6W
论文数: 1.5W
被引数: 184
T
Taibah University
学者数:
1.2K
论文数: 747
被引数: 3.9K
U
university of liverpool
学者数:
3.4K
论文数: 1.8K
被引数: 0
N
national research council
学者数:
1.9K
论文数: 770
被引数: 0
U
university of bologna
学者数:
6.0K
论文数: 2.5K
被引数: 0
学者 查看更多机构
引用论文

引用论文

Dataset of ontology competency questions to SPARQL-OWL queries translations
err2020-04-01
err0
errOAAI
errJedrzej Potoniec; Dawid Wiśniewski; Agnieszka Ławrynowicz; C. Maria Keet
err分享
err收藏
Can LLMs Generate Competency Questions?
err2025-01-01
err0
PREAI
errRebboud,Youssra; Tailhardat,Lionel; Lisena,Pasquale; Troncy,Raphael
err分享
err收藏
The future landscape of large language models in medicine医学中大型语言模型的未来前景
err2023-10-10
err259
errOAAI
errClusmann, Jan; Kolbinger, Fiona R.; Muti, Hannah Sophie; Carrero, Zunamys I.; Eckardt, Jan-Niklas; Laleh, Narmin Ghaffari; Loeffler, Chiara Maria Lavinia; Schwarzkopf, Sophie-Caroline; Unger, Michaela; Veldhuizen, Gregory P.; Wagner, Sophia J.; Kather, Jakob Nikolas
err分享
err收藏
err分享
err收藏
学者 查看更多内容