返回
Task-Guided Dynamic Visual Reasoning for Visual Question Answering
DOI:10.1142/S0219843625400122.png)
摘要
En 中文
视觉推理能力作为模型的一种高级认知能力,已被广泛研究。在视觉问答任务中,基于任务分解的符号推理方法使模型能够根据人类逻辑模式执行视觉推理,从而促进问答。该方法已在各种描述性问题类型上展现出优异性能。典型的视觉问答任务由一个问题与一幅图像配对构成。与围绕图像的静态视觉推理相比,涉及视频内容的动态视觉推理在逻辑、时序理解和因果结构方面提出了更高的挑战,使得先前的方法难以把握动态场景中对象间的动态相互关系。本研究提出了一种用于视觉问答的任务引导动态视觉推理方法,该方法建模动态场景中对象的时空状态,将问题分解为任务步骤,最终在建立的时空动态场景图神经网络上进行推理。我们使用两个基准数据集CLEVRER和CATER进行了实验验证,验证结果表明,我们的模型能够有效提取动态场景中对象的时空特征,在描述性问题中表现良好,并与对比模型相比提高了解释性和预测性问题的准确率。
Keyword:
Spatiotemporal modeling
visual question answering
dynamic visual reasoning
graph neural networks
symbolic reasoning
期刊
IF:
1.6
论文数:
57
被引数:
633
机构
引用论文
VQA and Visual Reasoning: An overview of approaches, datasets, and future direction
NEUROCOMPUTING
IF6.5

