返回
Adversarial attacks on large language models using regularized relaxation
DOI:10.1016/j.ins.2026.123112.png)
摘要
En 中文
随着大型语言模型(LLMs)在众多实际应用中变得不可或缺,确保其鲁棒性和安全性至关重要。尽管对齐技术的进步显著提升了整体安全性,LLMs 仍然容易受到旨在利用其漏洞的对抗性输入的影响。现有的对抗攻击方法存在明显局限性:基于离散标记的方法效率低下,而连续优化方法通常无法从模型词汇表中生成有效标记,使其难以应用于实际场景。在本文中,我们提出了正则化松弛(Regularized Relaxation)这一新型对抗攻击技术,通过利用正则化梯度克服上述限制,该梯度通过约束计算,鼓励优化后的嵌入保持在有效标记表示附近。这使得连续优化能够直接从模型词汇表中生成离散标记,同时保持攻击效果。我们的方法相比当前最先进的贪婪坐标梯度法实现了两个数量级的速度提升。在运行时间和效率方面显著优于其他近期方法,同时在大多数测试模型和数据集上持续实现更高的攻击成功率。关键在于,我们的方法直接从模型词汇表中生成有效标记,克服了以往连续优化方法的主要局限。我们通过在四个不同数据集上对五种最先进的 LLM 进行的广泛实验,证明了我们攻击方法的有效性。我们的实现代码公开可访问于:https://github.com/sj21j/Regularized_Relaxation。
Keyword:
Large language models(LLM)
Robustness
Adversarial attacks
Model jailbreaking
Alignment evasion
Prompt engineering
Generative AI


