返回
Transformer-based Multimodal Framework for Misogynous Meme Identification
DOI:10.1080/03772063.2025.2586735.png)
摘要
En 中文
社交媒体上模因(meme)流行度的近期上升既带来了娱乐性,也带来了挑战,其中模因被滥用以传播针对网络女性的厌女(misogyny)和有害(toxic)内容。现有的厌女检测方法往往仅关注文本或视觉内容,忽视了分析结合图像和文本的多模态数据的需求。我们提出了一种深度学习框架,即带有CROMA-SA模块的ViDe框架,用于模因中自动识别厌女内容。为提高所提出框架的泛化能力,我们整合了最新的深度学习框架DeBERTa和ViT,分别处理模因中的文本和图像。基于跨模态编码、基于注意力机制的晚期融合(attention based late-fusion)和自注意力(self attention)技术,提出了CROMA-SA模块,以确定模因的综合语境。为处理复杂的数据集及其类别不平衡问题,引入了一种名为复合损失(compound loss)的损失函数,增强了模型学习有效特征的能力。为评估有效性和适应性,我们在两个多样化的基准数据集上评估了所提出的ViDe框架:主要数据集为SemEval-2022任务5提供的MAMI数据集,次要数据集为Hateful Memes数据集。在主要数据集的子任务A和B上,所提出的框架分别取得了0.865和0.783的F1分数。在次要数据集上,所提出的框架取得了0.814的AUROC分数。实验结果表明,所提出的ViDe框架在两个数据集上都优于现有的最先进的多模态模型。
Keyword:
Cross-modal attention
Meme classification
Misogyny identification
Multimodal data
Self attention
期刊
IF:
1.3
论文数:
261
被引数:
3.3K
机构
引用论文
UPB at SemEval-2022 Task 5: Enhancing UNITER with Image Sentiment and Graph Convolutional Networks for Multimedia Automatic Misogyny IdentificationUPB在SemEval-2022任务5中:利用图像情感和图卷积网络增强UNITER,以实现多媒体自动厌女症识别

