arrow
返回

A Provable Optimization Framework for Knowledge Forgetting in Transformer Models

delete2026-09-25
delete0
PRE
AI
J
Jothi Prakash
S
S. Arul Antran Vijay
G
Gopikrishnan Sundaram
DOI:10.1109/tcds.2026.3735052delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
随着基于Transformer的语言模型越来越多地作为事实知识的存储库,选择性遗忘特定信息的能力对于纠正过时事实、缓解有害内容或遵守隐私法规变得至关重要。然而,当前模型编辑方法要么缺乏形式化保证,要么对无关知识造成不期望的干扰。在本文中,我们提出了可证明知识遗忘(PKF)框架,该框架能够有针对性地抑制事实信息,同时保留模型的总体功能。PKF将遗忘表述为一个受语义遗忘边界约束的优化问题,该边界利用Fisher信息量化模型原始行为的可接受偏差。为了使该方法可行,我们引入了一种低秩Fisher投影机制,以确保局部化编辑,并引入一个正则化项以最小化语义漂移。我们在三个基准数据集CounterFact、zsRE和TriviaQA上验证了PKF,使用了五种评估指标:Forget@1、AvgKL、知识干扰分数(KIS)、KISnorm和邻域一致性率(NCR)。我们的实验表明,PKF在遗忘成功率超过94%的同时,干扰显著低于ROME、MEND和KE等强基线方法。这项工作为语言模型中的可控遗忘提供了一种可扩展的、理论基础的解决方案,对安全性、合规性和模型寿命管理具有重要影响。
Keyword:
Knowledge forgetting
Transformer models
Model editing
Fisher information
Semantic drift

期刊

IEEE Transactions on Cognitive and Developmental Systems 封面图
IEEE Transactions on Cognitive and Developmental Systems
IF:
4.9
论文数:
1.0K
被引数:
3.5K

机构

V
vit-ap university
学者数:
58
论文数: 35
被引数: 0
K
karpagam college of engineering
学者数:
20
论文数: 12
被引数: 0
引用论文

引用论文

暂无论文信息