返回
Text Adversarial Attacks With Dynamic Outputs
DOI:10.1109/tifs.2026.3723158.png)
摘要
En 中文
文本对抗攻击方法通常针对具有固定输出标签数量和预定义标签空间的静态场景设计,依赖对目标模型(基于查询的攻击)或替代模型(基于迁移的攻击)的大量查询。然而,实际应用常涉及非静态输出。例如,大型语言模型(LLMs)可能生成超出预定义标签空间的标签,而在多标签分类任务中,预测标签数量会随输入动态变化。我们将这两种标签变异性(即动态标签内容和动态标签数量)称为动态输出(DO)场景。现有对抗攻击方法未针对此类设置设计,因此在DO条件下不直接适用。为弥补这一差距,我们提出文本动态输出攻击(TDOA)方法,采用基于聚类的替代模型训练方法,利用静态粗粒度标签近似动态细粒度输出,从而构建常规的单输出替代攻击空间。该近似在动态输出呈现连贯语义结构且生成的粗粒度聚类足够可靠时预期有效。为提升攻击效果,我们提出最远标签定向攻击策略,引导扰动朝语义上最远的粗粒度标签方向,旨在诱导目标模型输出的更大变化。我们在五个数据集和十个目标模型(如GPT-4o、GPT-4.1)上全面评估TDOA,证明其在构造对抗样本方面的有效性,以及其在有限访问权限下损害LLMs的潜力。在每文本五个查询下,TDOA达到最高80.8%的攻击成功率。此外,我们发现TDOA在传统静态输出场景中也达到SOTA性能,最高ASR达82.7%。我们进一步通过机器翻译实验将TDOA从动态标签设置扩展到开放式生成输出,而非将翻译视为具有无界标签空间的常规分类。在此扩展设置中,TDOA使RDBLEU和RDchrF指标较先前最佳结果分别提升0.11。
Keyword:
Text adversarial attack
dynamic outputs
large language models
期刊
IF:
8
论文数:
5.3K
被引数:
2.3W
机构
引用论文
暂无论文信息

