arrow
返回

DP2Unlearning: An efficient and guaranteed unlearning framework for LLMs

delete2025-07-18
delete0
PRE
AI
T
Tamim Al Mahmud *
N
Najeeb Jebreel
J
Josep Domingo‐Ferrer
D
David Sánchez
DOI:10.1016/j.neunet.2025.107879delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大型语言模型(LLMs)最近革新了语言处理任务,但也带来了伦理和法律问题。LLMs具有记忆训练数据中潜在私有或版权信息的倾向,这些信息随后可能在推理时被传递给终端用户。当这种情况发生时,一个简单的解决方案是在排除不需要的数据后从头重新训练模型。尽管这能确保目标数据已被遗忘,但对于LLMs来说,其成本也高得难以承受。近似遗忘提供了一种更高效的替代方案,因为它涉及对已训练模型本身进行事后修改以防止不良结果,但由于仅依赖实证证据,因此缺乏遗忘保证。在本工作中,我们提出了DP2Unlearning,一种新颖的LLM遗忘框架,它提供了正式的遗忘保证,其成本显著低于在需保留的数据上从头重新训练。DP2Unlearning涉及在通过ϵ-差分隐私(DP)保护的文本数据上训练LLMs,这后来能够实现具有与所选ϵ相关联的披露保证的高效遗忘。我们的实验表明,DP2Unlearning在遗忘后的模型性能与在保留数据上从头重新训练的LLM(精确遗忘的金标准)相当,但遗忘成本大约是其一半。此外,在合理的计算成本下,它在保留遗忘后模型的效用和有效遗忘目标信息方面均优于近似遗忘方法。
Keyword:
LLM unlearning
Exact unlearning
Approximate unlearning
Differential privacy
Privacy-preserving LLM

期刊

Neural Networks 封面图
Neural Networks
IF:
6.3
论文数:
7.8K
被引数:
3.0W

机构

暂无机构信息
引用论文

引用论文

Non-parametric Jensen-Shannon Divergence
err2015-08-29
err0
PREAI
errHoang-Vu Nguyen; Jilles Vreeken
err分享
err收藏
Analyzing Leakage of Personally Identifiable Information in Language Models
err2023-05-01
err0
errOAAI
errNils Lukas; Ahmed Salem; Robert Sim; Shruti Tople; Lukas Wutschitz; Santiago Zanella-Béguelin
err分享
err收藏
Deep Learning with Differential Privacy具有差分隐私的深度学习
err2016-10-24
err0
errOAAI
errMartin Abadi; Andy Chu; Ian Goodfellow; H. Brendan McMahan; Ilya Mironov; Kunal Talwar; Li Zhang
err分享
err收藏
学者 查看更多内容