返回
How to systematically and quantifiably remove meaning?
DOI:10.3389/frai.2026.1783410.png)
摘要
En 中文
大型语言模型日益介导现实世界任务;然而,我们缺乏系统的方法来量化其输入意义被侵蚀时性能的下降。为弥合这一差距,我们开发了一个框架,用于语义意义侵蚀并量化其强度;该框架基于话语分析、心理语言学和软件工程学,包含五种理论驱动的方:关键信息和上下文的省略、近义词的词汇替换、抽象程度的增加、结构混淆和重命名,以及逻辑错误的注入。我们将这些侵蚀算子应用于五个领域,并使用一个公开可用的语言模型量化了它们对模型性能的影响。双向方差分析(ANOVA)显示,领域和侵蚀方法均存在显著主效应,以及显著的交互作用,表明语义降级的影响取决于文本的侵蚀方式以及领域特定信息的编码方式。逻辑错误侵蚀对代码生成造成了特别严重的损害,而结构混淆则最强烈地损害了新闻和指令任务。对成对侵蚀联合的表型分析表明,某些组合产生了超加性降级,而其他组合则表现出补偿效应。这些领域-侵蚀剖面为诊断多步大型语言模型(LLM)管道最可能失效的位置提供了见解,并表明鲁棒性基准应沿领域特定的脆弱性维度探测模型,而非依赖通用扰动。语义侵蚀因此提供了一种原则性工具,用于将模型失效转化为关于语言模型如何构建和降级意义的证据。
Keyword:
large language models
meaning and semantics
meaning degradation
robustness evaluation
semantic erosion
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
F
IF:
4.7
论文数:
2.5K
被引数:
4.4K
机构
引用论文
An electrophysiological study of task demands on concreteness effects: evidence for dual coding theory任务需求对具体性影响的电生理研究: 双重编码理论的证据
Cultural Shift or Linguistic Drift? Comparing Two Computational
Measures of Semantic Change文化转移还是语言漂移?比较两个计算
语义变化的度量

