返回
Semantic Aggregated Adversarial Training Framework for Hate Speech Detection
DOI:10.1287/ijoc.2023.0508.png)
摘要
En 中文
仇恨言论对用户规模庞大且多样化的数字平台构成了日益严峻的挑战,促使广泛采用深度学习(DL)模型进行大规模自动化检测。然而,现有研究主要侧重于提高检测准确率,而对恶意传播者发起的对抗性攻击下DL检测模型的脆弱性关注有限。为弥合这一差距,我们提出了一种对抗训练框架,以提升仇恨言论检测的对抗鲁棒性。该框架整合了不平衡对抗训练与一种新颖的语义聚合技术,以从仇恨言论语料库中学习鲁棒且具有区分性的特征。我们进一步引入了一个对抗攻击生成框架,以评估现有DL基仇恨言论检测模型在这些攻击下的性能。在八个公开可用的仇恨言论语料库上进行的广泛计算实验证明了所提方法对攻击的鲁棒性。相比之下,我们表明现有的DL检测模型易受对抗攻击的影响,允许通过内容的细微修改传播仇恨情绪。此外,我们通过与各种对抗训练和不平衡训练方法的比较分析,展示了所提方法在同时解决仇恨言论检测中固有的数据不平衡和特征不可分问题方面的有效性。本研究提出了重要的管理启示,有助于在线平台实施有效措施以防止仇恨言论的传播。
Keyword:
hate speech detection
adversarial attack
adversarial training
semantic aggregation
data imbalance
responsible AI
期刊
I
IF:
2.1
论文数:
86
被引数:
3.2K
机构
引用论文
A survey on imbalanced learning: latest research, applications and future directions不平衡学习: 最新研究、应用与未来方向

