返回
AWMT: Automatic Jailbreaking Attack Framework Utilizing Working-Memory Trees
DOI:10.1016/j.eswa.2025.130643.png)
摘要
En 中文
• AWMT框架采用树结构和记忆来提升攻击效率。
• 多提示策略提高了越狱成功率与多样性。
• 在GPT-3.5-turbo上达到86%的攻击成功率,超越所有基线模型。
• 越狱提示具有可解释性,并且能在各类LLM中实现迁移。
期刊
IF:
7.5
论文数:
3.0W
被引数:
10.2W
机构
引用论文
A Survey on Large Language Model (LLM) Security and Privacy: The Good, The Bad, and The Ugly关于大型语言模型 (LLM) 安全性和隐私的调查: 好,坏和丑陋
没有更多内容

