返回
Statistical Runtime Verification for LLMs via Robustness Estimation
DOI:10.1007/978-3-032-05435-7_25.png)
摘要
En 中文
对抗鲁棒性验证对于确保大型语言模型(LLMs)在运行时关键应用中的安全部署至关重要。然而,由于现代LLMs的指数级运行时间和白盒访问要求,形式化验证技术仍然在计算上不可行。本文介绍了一个案例研究,通过调整和扩展RoMA统计验证框架,评估其在黑盒部署设置中作为在线运行时鲁棒性监控器的可行性。我们对RoMA的调整分析了语义扰动下的置信度分数分布,以提供具有统计验证边界的数据鲁棒性评估。我们针对形式化验证基线的经验验证表明,RoMA实现了可比的准确性(偏差在1%以内),并将验证时间从小时缩短到分钟。我们在语义、分类和正交扰动领域评估了该框架。结果表明RoMA在操作LLM部署中的鲁棒性监控方面的有效性。这些发现表明,当形式化方法不可行时,RoMA可能是一种可扩展的替代方案,对基于LLM的系统的运行时验证具有有前景的启示。
Keyword:
LLM safety
Neural Network Verification
LLM verification
Robustness
期刊
R
IF:
0
论文数:
27
被引数:
0

