返回
RefChartQA: Grounding Visual Answer on Chart Images Through Instruction Tuning
DOI:10.1007/978-3-032-04627-7_30.png)
摘要
En 中文
近期,视觉语言模型(VLMs)越来越重视文档视觉定位以实现更好的人机交互、可访问性和详细理解。然而,由于图表图像中交织的视觉-数值关系固有的复杂性,其在如图表等可视化中的应用仍较少被探索。现有的图表理解方法主要关注回答问题,而没有明确识别支持其预测的视觉元素。为弥补这一差距,我们提出了RefChartQA,一个将图表问答(ChartQA)与视觉定位相结合的新型基准,使模型能够在图表图像中引用多粒度的元素。此外,我们对6种不同类别的最新VLM进行了指令微调的全面评估。实验表明,通过定位引入空间感知可提高响应准确率超过15%,减少幻觉,并提升模型可靠性。此外,我们还识别了影响文本-空间对齐的关键因素,例如TinyChart在架构上的改进,其利用一个标记合并模块以增强特征融合。我们的数据集已开源以供社区发展和进一步研究。所有模型和代码将公开提供于https://github.com/moured/RefChartQA。
Keyword:
Vision Language Models
Chart Understanding
Visual Grounding
Instruction Tuning
Document Visual Grounding

