arrow
返回

LLM-Agnostic Semantic Representation Attack

delete2026-09-18
delete0
PRE
AI
J
Jiawei Lian
J
Jianhong Pan
L
Lefan Wang
Y
Yi Wang
T
Tairan Huang
S
Shaohui Mei
L
Lap-Pui Chau
DOI:10.1109/tpami.2026.3735535delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
大型语言模型(LLMs)越来越多地采用对齐技术以防止有害输出。尽管存在这些安全措施,但攻击者可以通过构造对抗性提示语来绕过它们。主流的基于词元级别的优化方法主要依赖于优化精确的肯定模板(例如,“Sure, here is...”)。然而,这些范式经常遇到诸如收敛不理想、提示语自然度降低以及跨模型泛化能力差等瓶颈。为解决这些局限性,我们提出了语义表示攻击(SRA),这是一种新颖的与LLM无关的范式,从根本上重新定义了对抗目标,从精确的文本靶向转向恶意语义表示。理论上,我们建立了一个连贯性-收敛性关系和跨模型语义泛化界,以表征语义收敛和可迁移性。技术上,我们通过语义表示启发式搜索(SRHS)算法实现该框架,该算法在增量离散词元块扩展过程中保留了对抗性提示语的可解释性和结构连贯性。广泛评估表明,我们的框架在26个开源LLMs上平均攻击成功率达到99.71%,并在评估设置中表现出强可迁移性和自然度。
Keyword:
LLM-Agnostic
Semantic Representation
Attack

期刊

IEEE Transactions on Pattern Analysis and Machine Intelligence 封面图
IEEE Transactions on Pattern Analysis and Machine Intelligence
IF:
18.6
论文数:
1.0K
被引数:
9.8W

机构

暂无机构信息
引用论文

引用论文

暂无论文信息