arrow
返回

On Measuring Large Language Models Performance with Inferential Statistics

delete2025-09-20
delete0
delete
OA
AI
J
Jesús M. Fraile-Hernández *
A
Anselmo Peñas
DOI:10.3390/info16090817delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
评估性能的可靠性在评价非确定性模型时尤为重要。这在使用大型语言模型(LLMs)进行分类任务的案例中尤为明显,因为不同的运行会生成不同的输出。这一事实引发了关于解决方案评估可靠性的问题。以往的工作依赖于执行多次运行,然后取某种平均值并结合置信区间。然而,如果执行次数不足,置信区间本身可能并不可靠。因此,需要更有效且稳健的方法来对其进行估计。在本工作中,我们提出了一种方法论,通过利用跨多个运行的实例级预测来估计模型性能,同时捕捉运行内的变异性,从而在金标准可用时实现更可靠的置信区间计算。我们的方法还通过减少估计性能变异性所需的全模型执行次数,提供了更高的计算效率。与现有的最先进评估方法相比,我们的方法在仅使用三次运行的情况下,实现了对可能性能结果的完全经验覆盖(100%),而传统方法即使使用八次运行,最多也仅能达到63%的覆盖。
Keyword:
performance evaluation
confidence intervals
LLMs
run variability
non-deterministic models
statistical evaluation
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

I
Information
IF:
2.9
论文数:
833
被引数:
9.8K

机构

暂无机构信息
引用论文

引用论文

Understanding The New Statistics
err
IF0
err2013-06-19
err0
PREAI
errGeoff Cumming
err分享
err收藏
Evaluating non-deterministic retrieval systems
err2014-07-03
err0
PREAI
errJayasinghe,Gaya K.; Webber,William; Sanderson,Mark; Dharmasena,Lasitha S.; Culpepper,J. Shane
err分享
err收藏
Estimation statistics should replace significance testing
err2016-01-28
err85
errOAAI
errClaridge-Chang, Adam; Assam, Pryseley N.
err分享
err收藏
An Introduction to the Bootstrap
err
IF0
err1994-05-15
err0
PREAI
errBradley Efron; R.J. Tibshirani
err分享
err收藏
The Stationary Bootstrap
err2012-02-27
err0
PREAI
errDimitris N. Politis; Joseph P. Romano
err分享
err收藏
Uncertainty Quantification with Pre-trained Language Models: A Large-Scale Empirical Analysis
err2022-01-01
err0
errOAAI
errYuxin Xiao; Paul Pu Liang; Umang Bhatt; Willie Neiswanger; Ruslan Salakhutdinov; Louis-Philippe Morency
err分享
err收藏
学者 查看更多内容