返回
A visual question answering method based on task decomposition
DOI:10.1371/journal.pone.0336623.png)
摘要
En 中文
视觉问答(VQA)作为计算机视觉和自然语言处理(NLP)的跨学科任务,用于评估模型的可视化推理能力,这需要整合图像信息提取技术与自然语言理解技术。在控制潜在偏差的专业基准测试中表明,基于任务分解的VQA方法是一种有前景的途径,相比仅依赖多模态融合的传统VQA方法,它在程序执行阶段的可解释性方面具有优势,并能减少对数据偏差的依赖。基于任务分解的VQA方法通过解析自然语言来分解任务,通常采用序列到序列(sequence-to-sequence)网络进行语言解析。然而,当面对灵活多样的自然语言时,该方法存在局限性,难以准确分解任务。为解决此问题,我们提出了图到序列任务分解网络(Graph2Seq-TDN),该网络利用自然语言的语义结构信息指导任务分解过程,以提高解析精度;此外,在推理执行方面,除原有的符号推理执行外,我们还提出了一个推理执行器以增强执行性能。我们在四个数据集(CLEVR、CLEVR-Human、CLEVR-CoGenT和GQA)上进行了验证。实验结果表明,在相同准确率下,我们的模型在回答准确率、程序准确率和训练成本方面均优于对比模型。
Keyword:
Visual question answering
Task decomposition
Natural language parsing
Semantic structure
Reasoning execution
期刊
IF:
2.6
论文数:
2.6W
被引数:
81.6W
机构
引用论文
VQA-GNN: Reasoning with Multimodal Knowledge via Graph Neural Networks for Visual Question Answering
Graph-enhanced visual representations and question-guided dual attention for visual question answering
NEUROCOMPUTING
IF6.5

