arrow
返回

Decoding Multimodal Text Analytics: Tasks, Datasets, Fusion Models, and Future Frontiers

delete2026-04-07
delete0
PRE
AI
T
Tanusree Nath
V
Vedika Gupta *
M
Manjari Gupta
R
Rajesh Sharma
DOI:10.1002/widm.70083delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
据估计,到2025年,数字前沿的数据量将呈指数级增长,达到180泽字节,其中超过90%的数据将以非结构化形式存在。这一现象引发了从单模态到多模态文本分析(MTA)的发展。多模态文本的早期引入在2010年代初的学术文献和工业用例中有所观察。自那时以来,它已大大扩展了在医疗保健、电子商务、教育和公共安全等其他领域的前景。本综述提出了一种任务导向、模态包容和数据集感知的MTA近期进展的综合分析,通过多模态视角对10项核心文本分析任务进行了深入回顾。我们系统分析了超过160项研究,并对超过120种最先进模型进行了分类,涵盖融合策略、表示学习、Transformer架构和预训练视觉-语言框架(如CLIP、ViLBERT)。在包括CMU-MOSI、CMU-MOSEI、IEMOCAP和MAViT-Bangla在内的多种数据集中,多模态模型相比纯文本基线在F1分数上实现了高达18%–25%的提升,这些结果记录在本综述的标准任务比较表中。此外,本综述讨论了七项探索不足的任务,包括人格检测、讽刺检测和作者画像,并阐述了这些任务在模态融合、数据集多样性以及社会包容性方面的研究空白。它不仅通过整合跨领域知识填补了当前文献的空白,也为从事MTA研究的学者提供了未来方向。与其他仅从管理层面提及多模态计算或专注于特定任务的综述相比,本综述是首个将多模态文本分析中的所有关键任务纳入连续且一致概述的综述。
Keyword:
emotion recognition
fake news
hate speech
sentiment analysis
transformer architectures
vision-language models

期刊

W
wires data mining and knowledge discovery
IF:
0
论文数:
36
被引数:
0

机构

B
banaras hindu university
学者数:
700
论文数: 267
被引数: 0
U
university of tartu
学者数:
1.4K
论文数: 588
被引数: 0
O
o.p. jindal global university
学者数:
194
论文数: 155
被引数: 2
学者 查看更多机构
引用论文

引用论文

M-Arg: Multimodal Argument Mining Dataset for Political Debates with Audio and Transcripts
err
IF0
err2021-01-01
err0
PREAI
errRafael Mestre; Razvan Milicin; Stuart Middleton; Matt Ryan; Jiatong Zhu; Timothy J. Norman
err分享
err收藏
Mapping Memes to Words for Multimodal Hateful Meme Classification
err2023-10-02
err0
PREAI
errBurbi,Giovanni; Baldrati,Alberto; Agnolucci,Lorenzo; Bertini,Marco; Del Bimbo,Alberto
err分享
err收藏
RUHate-MM: Identification of Hate Speech and Targets using Multimodal Data from Russia-Ukraine Crisis
err2024-05-13
err0
PREAI
errThapa,Surendrabikram; Jafri,Farhan Ahmad; Rauniyar,Kritesh; Nasim,Mehwish; Naseem,Usman
err分享
err收藏
MVAE: Multimodal Variational Autoencoder for Fake News Detection
err2019-05-13
err0
PREAI
errDhruv Khattar; Jaipal Singh Goud; Manish Gupta; Vasudeva Varma
err分享
err收藏
Transformer-based models for multimodal irony detection
err2022-10-19
err0
errOAAI
errDavid Tomás; Reynier Ortega-Bueno; Guobiao Zhang; Paolo Rosso; Rossano Schifanella
err分享
err收藏
Knowledge-aware multimodal pre-training for fake news detection面向假新闻检测的知识感知多模态预训练
err2025-02-01
err0
PREAI
errZhang, Litian; Zhang, Xiaoming; Zhou, Ziyi; Zhang, Xi; Yu, Philip S.; Li, Chaozhuo
err分享
err收藏
学者 查看更多内容