arrow
返回

A Unified Optimization Framework for Backdoor Attacks in Large Language Models

delete2026-02-12
delete0
PRE
AI
Y
Yan Shi
W
Wenlong Zheng
H
He Ayu Xu
王旭 封面图
王旭 (Xu An Wang)
R
Ruchuan Wang
DOI:10.1016/j.inffus.2026.104221delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 提出一种针对大型语言模型的后门攻击框架。 • 从理论上证明部分参数更新的充分性。 • 解决干净目标与对抗目标之间的梯度冲突。 • 验证更高的成功率,同时保持最小的干净任务性能下降。
Keyword:
Backdoor Attacks
Large Language Models
Optimization Framework
Gradient Conflict
Parameter Updates

期刊

Information Fusion 封面图
Information Fusion
IF:
15.5
论文数:
4.2K
被引数:
2.7W

机构

N
nanjing university of posts and telecommunications
学者数:
3.8K
论文数: 1.6K
被引数: 0
E
Engineering University of Pap
学者数:
421
论文数: 288
被引数: 1
引用论文

引用论文

Neutralizing Backdoors through Information Conflicts for Large Language Models
err
IF0
err
err0
PREAI
errChen,Chen; Sun,Yuchen; Gong,Xueluan; Gao,Jiaxin; Lam,Kwok-Yan
err分享
err收藏
Trojanrag: Retrieval-Augmented Generation Can Be Backdoor Driver in Large Language Models
err
IF0
err
err0
PREAI
errCheng,Pengzhou; Ding,Yidong; Ju,Tianjie; Wu,Zongru; Du,Wei; Zhao,Haodong; Y,Haiyang; Yi,Ping; Zhang,Zhuosheng; Liu,Gongshen
err分享
err收藏
err分享
err收藏
Multitask learning多任务学习
err1997-01-01
err4.9K
errOAAI
errCaruana, R
err分享
err收藏
A trigger-perceivable backdoor attack framework driven by image steganography
err2025-05-01
err0
PREAI
errTang, Weixuan; Li, Jiahao; Rao, Yuan; Zhou, Zhili; Peng, Fei
err分享
err收藏
Red Alarm for Pre-trained Models: Universal Vulnerability to Neuron-level Backdoor Attacks
err2023-03-02
err19
PREAI
errZhang, Zhengyan; Xiao, Guangxuan; Li, Yongwei; Lv, Tian; Qi, Fanchao; Liu, Zhiyuan; Wang, Yasheng; Jiang, Xin; Sun, Maosong
err分享
err收藏
FedBone: Towards Large-Scale Federated Multi-Task Learning
err
IF0
err2024-12-05
err0
PREAI
errYi-Qiang Chen; Teng Zhang; Xin-Long Jiang; Qian Chen; Chen-Long Gao; Wu-Liang Huang
err分享
err收藏
没有更多内容