arrow
返回

A visual question answering method based on task decomposition

delete2025-11-13
delete0
PRE
AI
C
Cong Yao
H
Hongwei Mo *
DOI:10.1371/journal.pone.0336623delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
视觉问答(VQA)作为计算机视觉和自然语言处理(NLP)的跨学科任务,用于评估模型的可视化推理能力,这需要整合图像信息提取技术与自然语言理解技术。在控制潜在偏差的专业基准测试中表明,基于任务分解的VQA方法是一种有前景的途径,相比仅依赖多模态融合的传统VQA方法,它在程序执行阶段的可解释性方面具有优势,并能减少对数据偏差的依赖。基于任务分解的VQA方法通过解析自然语言来分解任务,通常采用序列到序列(sequence-to-sequence)网络进行语言解析。然而,当面对灵活多样的自然语言时,该方法存在局限性,难以准确分解任务。为解决此问题,我们提出了图到序列任务分解网络(Graph2Seq-TDN),该网络利用自然语言的语义结构信息指导任务分解过程,以提高解析精度;此外,在推理执行方面,除原有的符号推理执行外,我们还提出了一个推理执行器以增强执行性能。我们在四个数据集(CLEVR、CLEVR-Human、CLEVR-CoGenT和GQA)上进行了验证。实验结果表明,在相同准确率下,我们的模型在回答准确率、程序准确率和训练成本方面均优于对比模型。
Keyword:
Visual question answering
Task decomposition
Natural language parsing
Semantic structure
Reasoning execution

期刊

PLoS One 封面图
PLoS One
IF:
2.6
论文数:
2.6W
被引数:
81.6W

机构

H
harbin engineering university
学者数:
5.6K
论文数: 2.0K
被引数: 0
引用论文

引用论文

Confidence-based interactable neural-symbolic visual question answering
err2024-01-01
err10
PREAI
errBao, Yajie; Xing, Tianwei; Chen, Xun
err分享
err收藏
err分享
err收藏
Visual question answering: Which investigated applications?
err2021-11-01
err24
errOAAI
errBarra, Silvio; Bisogni, Carmen; De Marsico, Maria; Ricciardi, Stefano
err分享
err收藏
Graph-enhanced visual representations and question-guided dual attention for visual question answering
err2025-01-01
err1
PREAI
errYusuf, Abdulganiyu Abdu; Feng, Chong; Mao, Xianling; Haruna, Yunusa; Li, Xinyan; Duma, Ramadhani Ally
err分享
err收藏
CLEVR: A Diagnostic Dataset for Compositional Language and Elementary Visual Reasoning
err2017-07-01
err0
errOAAI
errJustin Johnson; Bharath Hariharan; Laurens van der Maaten; Li Fei-Fei; C. Lawrence Zitnick; Ross Girshick
err分享
err收藏
学者 查看更多内容