返回
A Framework for Assessing LLM Consistency in Knowledge Engineering
DOI:10.1177/22104968261479512.png)
摘要
En 中文
一致性,即系统、过程或其结果在重复相同或不同条件下产生相似结果的程度,是知识工程(KE)中的关键问题。随着大型语言模型(LLMs)在各项任务中日益受到依赖,这一问题尤为突出。本文介绍了CoLLM框架,该框架通过三种测试来评估系统或过程在基于LLMs的KE任务中是否产生一致结果:(i)《LLM重复性测试》,用于评估现有研究中LLMs的随机性或非确定性水平;(ii)《LLM更新影响测试》,用于检验LLMs更新对结果的影响;(iii)《LLM替换测试》,用于探索使用替代LLMs执行相同研究的效果。通过来自五个不同最新研究的59项不同实验,并利用多种LLMs和数据集,我们研究了结果的一致性,以实证验证每项研究的原始发现的可靠性。我们的调查表明,在大多数情况下(81.4%),尽管个体输出存在一些变化,但仍可观察到与原始研究一致的行为。此外,在某些情况下,更改LLMs的选择可以导致不同指标上的一致性改进。这些结果表明,所提出的框架在评估基于LLMs的KE任务的一致性方面具有可行性。
期刊
IF:
2.9
论文数:
607
被引数:
1.6K
机构
引用论文
Machine Learning-Friendly Biomedical Datasets for Equivalence and Subsumption Ontology Matching机器学习友好的生物医学数据集用于等价性和包含性本体匹配

