返回
Learning Compositionality from Multifaceted Synthetic Data for Language-based Object Detection
DOI:10.1007/s11263-025-02554-9.png)
摘要
En 中文
基于语言的目标检测旨在从复杂的语言查询中定位目标对象。然而,当前的视觉-语言检测器在理解视觉对象的复杂表示(如属性、形状和关系)方面常常遇到困难,尤其是在处理复杂查询时。在本文中,我们首先对当前基于语言检测器进行了全面分析,以识别其在组合理解方面的具体弱点。为此,我们提出了一种新颖的综合评估框架,该框架利用大型语言模型(LLMs)自动根据组合的类型和复杂度对测试案例进行分类。这一框架揭示,检测器在复杂度增加时表现出显著的性能下降,并在特定类型(如空间和数值推理)上存在一致性的失败。为了有效解决这一问题,我们提出了一种多方面的合成数据,包括:(1) 基于生成模型的合成三元组,这些三元组从大型生成模型(如LLMs、扩散模型)中继承了组合知识,形式为图像-文本-边界框数据;(2) 针对弱点设计的合成描述,旨在增强对易损类型(如空间和数字概念)的理解。我们进一步引入了一种组合对比学习方法,以更好地利用所提出的合成数据,同时缓解合成数据的常见缺陷。因此,我们使用所提出的多方面合成数据训练的模型在Omnilabel基准测试中相比现有基线最高提升了+7.1AP,在$$\hbox {D}^{3}$$基准测试中最高提升了$$+8.4$$ AP。
Keyword:
Multimodal Synthetic Datasets
Compositional Learning
Transfer Learning
Language-based Object Detection
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W
机构
引用论文
Weak-to-Strong Compositional Learning from Generative Models for Language-Based Object Detection基于生成模型的语言目标检测的弱到强组合学习

