返回
MathAttack: Attacking Large Language Models towards Math Solving Ability
DOI:10.1609/aaai.v38i17.29949.png)
摘要
En 中文
随着大型语言模型(LLMs)的兴起,解决数学文字题(MWP)的研究近期取得了巨大进展。然而,鲜有研究考察LLMs在数学求解能力方面的鲁棒性。不同于攻击LLMs使用中的提示,我们提出了MathAttack模型来攻击MWP样本,这些样本更接近于解决数学问题鲁棒性的本质。与传统的文本对抗攻击相比,在攻击过程中保留原始MWP的数学逻辑至关重要。为此,我们提出了逻辑实体识别以识别逻辑实体,然后将这些实体冻结。随后,采用基于词级的攻击者对剩余文本进行攻击。此外,我们提出了一个新的数据集RobustMath,用于评估LLMs在数学求解能力方面的鲁棒性。在RobustMath、GSM8K和MultiAirth两个数学基准数据集上的广泛实验表明,MathAttack能够有效攻击LLMs的数学求解能力。在实验中,我们观察到:(1) 我们针对高精度LLMs生成的对抗样本,对于攻击低精度LLMs同样有效(例如,从大模型到小模型的迁移,或从少样本提示到零样本提示的迁移);(2) 复杂的MWP(如更多求解步骤、更长文本、更多数字)更容易受到攻击;(3) 我们可以通过在少样本提示中使用对抗样本来提高LLMs的鲁棒性。最后,我们希望我们的实践和观察能够为增强LLMs在数学求解能力方面的鲁棒性提供一个重要的尝试。代码和数据集可访问:https://github.com/zhouzihao501/MathAttack。
期刊
暂无期刊信息
机构
暂无机构信息
引用论文
暂无论文信息

