返回
A Unified Optimization Framework for Backdoor Attacks in Large Language Models
DOI:10.1016/j.inffus.2026.104221.png)
摘要
En 中文
• 提出一种针对大型语言模型的后门攻击框架。
• 从理论上证明部分参数更新的充分性。
• 解决干净目标与对抗目标之间的梯度冲突。
• 验证更高的成功率,同时保持最小的干净任务性能下降。
Keyword:
Backdoor Attacks
Large Language Models
Optimization Framework
Gradient Conflict
Parameter Updates
期刊
IF:
15.5
论文数:
4.2K
被引数:
2.7W
机构
引用论文
Backdoor Attacks and Countermeasures in Natural Language Processing Models: A Comprehensive Security Review自然语言处理模型中的后门攻击与防御措施:一项全面的网络安全综述
A trigger-perceivable backdoor attack framework driven by image steganography
PATTERN RECOGNITION
IF7.6
Syntactic paraphrase-based synthetic data generation for backdoor attacks against Chinese language models基于句法改写的中式语言模型后门攻击合成数据生成
Information Fusion
IF15.5
Backdoor attacks and defense mechanisms in federated learning: A survey联邦学习中的后门攻击与防御机制:一项综述
INFORMATION FUSION
IF15.5
没有更多内容

