arrow
返回

AWMT: Automatic Jailbreaking Attack Framework Utilizing Working-Memory Trees

delete2025-12-04
delete0
PRE
AI
张
张志强 (Zhiqiang Zhang)
J
Junjie Xu
李
李冰 (Bing Li)
Y
Yuankang Sun
H
Haimiao Mo
Y
Y.W Chen
DOI:10.1016/j.eswa.2025.130643delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• AWMT框架采用树结构和记忆来提升攻击效率。 • 多提示策略提高了越狱成功率与多样性。 • 在GPT-3.5-turbo上达到86%的攻击成功率,超越所有基线模型。 • 越狱提示具有可解释性,并且能在各类LLM中实现迁移。

期刊

Expert Systems with Applications 封面图
Expert Systems with Applications
IF:
7.5
论文数:
3.0W
被引数:
10.2W

机构

Z
Zhejiang University of Finance and Economics
学者数:
363
论文数: 260
被引数: 25
S
Southeast University
学者数:
2.1W
论文数: 8.6K
被引数: 480
S
Southern University of Science and Technology
学者数:
5.2K
论文数: 2.1K
被引数: 34
学者 查看更多机构
引用论文

引用论文

What is attentional refreshing in working memory?工作记忆中的注意力刷新是什么?
err2018-03-15
err110
errOAAI
errCamos, Valerie; Johnson, Matthew; Loaiza, Vanessa; Portrat, Sophie; Souza, Alessandra; Vergauwe, Evie
err分享
err收藏
Benchmarking Large Language Models for News Summarization
err2024-01-31
err48
errOAAI
errZhang, Tianyi; Ladhak, Faisal; Durmus, Esin; Liang, Percy; Mckeown, Kathleen; Hashimoto, Tatsunori B.
err分享
err收藏
PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts
err2024-11-19
err0
PREAI
errKaijie Zhu; Jindong Wang; Jiaheng Zhou; Zichen Wang; Hao Chen; Yidong Wang; Linyi Yang; Wei Ye; Yue Zhang; Neil Gong; Xing Xie
err分享
err收藏
ChatGPT
err2023-07-17
err3
PREAI
errWelsby, Philip; Cheung, Bernard M. Y.
err分享
err收藏
没有更多内容