返回
Refined generation-based framework for consistent and reliable visual question answering
DOI:10.1016/j.patcog.2026.113421.png)
摘要
En 中文
• 该工作首次同时提升了VQA模型的连贯性和可靠性。
• 本研究提出了一种统一的框架,能够兼容不同的模型。
• 本研究设计了一种新颖的生成模块,以扩充数据以实现更好的训练效果。
• 本研究在相关基准测试上取得了新的SOTA(State-of-the-Art)结果。
Keyword:
Visual Question Answering
Consistency
Reliability
Data Augmentation
SOTA Results
期刊
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
引用论文
暂无论文信息

