arrow
返回

Semantic Aggregated Adversarial Training Framework for Hate Speech Detection

delete2026-01-01
delete0
PRE
AI
X
Xingwei Zhang
T
Tian, Hu
X
Xiaole Zheng *
景鹏 封面图
景鹏 (Jing Peng)
D
Daniel Zeng
DOI:10.1287/ijoc.2023.0508delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
仇恨言论对用户规模庞大且多样化的数字平台构成了日益严峻的挑战,促使广泛采用深度学习(DL)模型进行大规模自动化检测。然而,现有研究主要侧重于提高检测准确率,而对恶意传播者发起的对抗性攻击下DL检测模型的脆弱性关注有限。为弥合这一差距,我们提出了一种对抗训练框架,以提升仇恨言论检测的对抗鲁棒性。该框架整合了不平衡对抗训练与一种新颖的语义聚合技术,以从仇恨言论语料库中学习鲁棒且具有区分性的特征。我们进一步引入了一个对抗攻击生成框架,以评估现有DL基仇恨言论检测模型在这些攻击下的性能。在八个公开可用的仇恨言论语料库上进行的广泛计算实验证明了所提方法对攻击的鲁棒性。相比之下,我们表明现有的DL检测模型易受对抗攻击的影响,允许通过内容的细微修改传播仇恨情绪。此外,我们通过与各种对抗训练和不平衡训练方法的比较分析,展示了所提方法在同时解决仇恨言论检测中固有的数据不平衡和特征不可分问题方面的有效性。本研究提出了重要的管理启示,有助于在线平台实施有效措施以防止仇恨言论的传播。
Keyword:
hate speech detection
adversarial attack
adversarial training
semantic aggregation
data imbalance
responsible AI

期刊

I
INFORMS Journal on Computing
IF:
2.1
论文数:
86
被引数:
3.2K

机构

I
institute of automation, cas
学者数:
2.2K
论文数: 2.1K
被引数: 2
P
peking university
学者数:
11.9W
论文数: 8.7W
被引数: 146
C
chinese academy of sciences
学者数:
56.7W
论文数: 45.0W
被引数: 704
学者 查看更多机构
引用论文

引用论文

err分享
err收藏
Just Another Day on Twitter: A Complete 24 Hours of Twitter Data
err2023-06-02
err0
errOAAI
errJürgen Pfeffer; Daniel Matter; Kokil Jaidka; Onur Varol; Afra Mashhadi; Jana Lasser; Dennis Assenmacher; Siqi Wu; Diyi Yang; Cornelia Brantner; Daniel M. Romero; Jahna Otterbacher; Carsten Schwemmer; Kenneth Joseph; David Garcia; Fred Morstatter
err分享
err收藏
Training Language Models to Follow Instructions with Human Feedback通过人类反馈训练语言模型以遵循指令
err2022-01-01
err0
PREAI
errAgarwal,Sandhini; Almeida,Diogo; Askell,Amanda; Christiano,Paul; Hilton,Jacob; Jiang,Xu; Kelton,Fraser; Leike,Jan; Lowe,Ryan; Miller,Luke; Mishkin,Pamela; Ouyang,Long; Ray,Alex; Schulman,John; Simens,Maddie; Slama,Katarina; Wainwright,Carroll; Welinder,Peter; Wu,Jeffrey; Zhang,Chong
err分享
err收藏
Sociotechnical Harms of Algorithmic Systems: Scoping a Taxonomy for Harm Reduction
err2023-08-29
err0
errOAAI
errRenee Shelby; Shalaleh Rismani; Kathryn Henne; AJung Moon; Negar Rostamzadeh; Paul Nicholas; N'Mah Yilla-Akbari; Jess Gallegos; Andrew Smart; Emilio Garcia; Gurleen Virk
err分享
err收藏
Offensive, aggressive, and hate speech analysis: From data-centric to human-centered approach
err2021-09-01
err50
errOAAI
errKocon, Jan; Figas, Alicja; Gruza, Marcin; Puchalska, Daria; Kajdanowicz, Tomasz; Kazienko, Przemyslaw
err分享
err收藏
Imbalanced Adversarial Training with Reweighting
err2022-11-01
err0
errOAAI
errWentao Wang; Han Xu; Xiaorui Liu; Yaxin Li; Bhavani Thuraisingham; Jiliang Tang
err分享
err收藏
学者 查看更多内容