返回
Decoding Multimodal Text Analytics: Tasks, Datasets, Fusion Models, and Future Frontiers
DOI:10.1002/widm.70083.png)
摘要
En 中文
据估计,到2025年,数字前沿的数据量将呈指数级增长,达到180泽字节,其中超过90%的数据将以非结构化形式存在。这一现象引发了从单模态到多模态文本分析(MTA)的发展。多模态文本的早期引入在2010年代初的学术文献和工业用例中有所观察。自那时以来,它已大大扩展了在医疗保健、电子商务、教育和公共安全等其他领域的前景。本综述提出了一种任务导向、模态包容和数据集感知的MTA近期进展的综合分析,通过多模态视角对10项核心文本分析任务进行了深入回顾。我们系统分析了超过160项研究,并对超过120种最先进模型进行了分类,涵盖融合策略、表示学习、Transformer架构和预训练视觉-语言框架(如CLIP、ViLBERT)。在包括CMU-MOSI、CMU-MOSEI、IEMOCAP和MAViT-Bangla在内的多种数据集中,多模态模型相比纯文本基线在F1分数上实现了高达18%–25%的提升,这些结果记录在本综述的标准任务比较表中。此外,本综述讨论了七项探索不足的任务,包括人格检测、讽刺检测和作者画像,并阐述了这些任务在模态融合、数据集多样性以及社会包容性方面的研究空白。它不仅通过整合跨领域知识填补了当前文献的空白,也为从事MTA研究的学者提供了未来方向。与其他仅从管理层面提及多模态计算或专注于特定任务的综述相比,本综述是首个将多模态文本分析中的所有关键任务纳入连续且一致概述的综述。
Keyword:
emotion recognition
fake news
hate speech
sentiment analysis
transformer architectures
vision-language models
期刊
W
IF:
0
论文数:
36
被引数:
0
机构
引用论文
A Content Filtering from Spam Posts on Social Media using Weighted Multimodal Approach基于加权多模态方法的社会媒体垃圾帖子内容过滤
Knowledge-aware multimodal pre-training for fake news detection面向假新闻检测的知识感知多模态预训练
INFORMATION FUSION
IF15.5
A multimodal fake news detection model based on crossmodal attention residual and multichannel convolutional neural networks基于跨模态注意力残差和多通道卷积神经网络的多模态假新闻检测模型

