arrow
返回

Transformer-based Multimodal Framework for Misogynous Meme Identification

delete2025-11-01
delete0
PRE
AI
N
Nitin Singh *
P
Prativa Das
P
Pardeep Singh
S
Satish Chand
DOI:10.1080/03772063.2025.2586735delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
社交媒体上模因(meme)流行度的近期上升既带来了娱乐性,也带来了挑战,其中模因被滥用以传播针对网络女性的厌女(misogyny)和有害(toxic)内容。现有的厌女检测方法往往仅关注文本或视觉内容,忽视了分析结合图像和文本的多模态数据的需求。我们提出了一种深度学习框架,即带有CROMA-SA模块的ViDe框架,用于模因中自动识别厌女内容。为提高所提出框架的泛化能力,我们整合了最新的深度学习框架DeBERTa和ViT,分别处理模因中的文本和图像。基于跨模态编码、基于注意力机制的晚期融合(attention based late-fusion)和自注意力(self attention)技术,提出了CROMA-SA模块,以确定模因的综合语境。为处理复杂的数据集及其类别不平衡问题,引入了一种名为复合损失(compound loss)的损失函数,增强了模型学习有效特征的能力。为评估有效性和适应性,我们在两个多样化的基准数据集上评估了所提出的ViDe框架:主要数据集为SemEval-2022任务5提供的MAMI数据集,次要数据集为Hateful Memes数据集。在主要数据集的子任务A和B上,所提出的框架分别取得了0.865和0.783的F1分数。在次要数据集上,所提出的框架取得了0.814的AUROC分数。实验结果表明,所提出的ViDe框架在两个数据集上都优于现有的最先进的多模态模型。
Keyword:
Cross-modal attention
Meme classification
Misogyny identification
Multimodal data
Self attention

期刊

IETE Journal of Research 封面图
IETE Journal of Research
IF:
1.3
论文数:
261
被引数:
3.3K

机构

J
jawaharlal nehru university, new delhi
学者数:
3.8K
论文数: 3.5K
被引数: 2
引用论文

引用论文

Long Short-Term Memory长短期记忆
err1997-11-01
err0
PREAI
errSepp Hochreiter; Jürgen Schmidhuber
err分享
err收藏
err分享
err收藏
学者 查看更多内容