arrow
返回

Learning Compositionality from Multifaceted Synthetic Data for Language-based Object Detection

delete2025-08-12
delete0
PRE
AI
K
Kwanyong Park
S
Sojung An
Y
Yong Jae Lee
D
Donghyun Kim *
DOI:10.1007/s11263-025-02554-9delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
基于语言的目标检测旨在从复杂的语言查询中定位目标对象。然而,当前的视觉-语言检测器在理解视觉对象的复杂表示(如属性、形状和关系)方面常常遇到困难,尤其是在处理复杂查询时。在本文中,我们首先对当前基于语言检测器进行了全面分析,以识别其在组合理解方面的具体弱点。为此,我们提出了一种新颖的综合评估框架,该框架利用大型语言模型(LLMs)自动根据组合的类型和复杂度对测试案例进行分类。这一框架揭示,检测器在复杂度增加时表现出显著的性能下降,并在特定类型(如空间和数值推理)上存在一致性的失败。为了有效解决这一问题,我们提出了一种多方面的合成数据,包括:(1) 基于生成模型的合成三元组,这些三元组从大型生成模型(如LLMs、扩散模型)中继承了组合知识,形式为图像-文本-边界框数据;(2) 针对弱点设计的合成描述,旨在增强对易损类型(如空间和数字概念)的理解。我们进一步引入了一种组合对比学习方法,以更好地利用所提出的合成数据,同时缓解合成数据的常见缺陷。因此,我们使用所提出的多方面合成数据训练的模型在Omnilabel基准测试中相比现有基线最高提升了+7.1AP,在$$\hbox {D}^{3}$$基准测试中最高提升了$$+8.4$$ AP。
Keyword:
Multimodal Synthetic Datasets
Compositional Learning
Transfer Learning
Language-based Object Detection

期刊

International Journal of Computer Vision 封面图
International Journal of Computer Vision
IF:
9.3
论文数:
3.9K
被引数:
2.8W

机构

K
Korea University
学者数:
3.6W
论文数: 3.8W
被引数: 4.4W
U
University of Seoul
学者数:
3.5K
论文数: 4.5K
被引数: 4.4K
U
university of wisconsin-madison
学者数:
3.5K
论文数: 1.5K
被引数: 2
学者 查看更多机构
引用论文

引用论文

Structured Domain Randomization: Bridging the Reality Gap by Context-Aware Synthetic Data
err2019-05-01
err0
errOAAI
errAayush Prakash; Shaad Boochoon; Mark Brophy; David Acuna; Eric Cameracci; Gavriel State; Omer Shapira; Stan Birchfield
err分享
err收藏
End-to-End Object Detection with Transformers使用Transformers进行端到端对象检测
err2020-11-03
err0
PREAI
errNicolas Carion; Francisco Massa; Gabriel Synnaeve; Nicolas Usunier; Alexander Kirillov; Sergey Zagoruyko
err分享
err收藏
Task2Sim: Towards Effective Pre-training and Transfer from Synthetic Data
err2022-06-01
err0
errOAAI
errSamarth Mishra; Rameswar Panda; Cheng Perng Phoo; Chun-Fu Richard Chen; Leonid Karlinsky; Kate Saenko; Venkatesh Saligrama; Rogerio S. Feris
err分享
err收藏
OmniLabel: A Challenging Benchmark for Language-Based Object DetectionOmniLabel:一个基于语言的物体检测挑战性基准
err2023-10-01
err0
PREAI
errSchulter,Samuel; G,Vijay Kumar B; Suh,Yumin; Dafnis,Konstantinos M.; Zhang,Zhixing; Zhao,Shiyu; Metaxas,Dimitris
err分享
err收藏
MDETR - Modulated Detection for End-to-End Multi-Modal Understanding
err2021-10-01
err0
errOAAI
errAishwarya Kamath; Mannat Singh; Yann LeCun; Gabriel Synnaeve; Ishan Misra; Nicolas Carion
err分享
err收藏
Teaching Structured Vision & Language Concepts to Vision & Language Models教授结构化视觉与语言概念给视觉与语言模型
err2023-06-01
err0
PREAI
errSivan Doveh; Assaf Arbelle; Sivan Harary; Eli Schwartz; Roei Herzig; Raja Giryes; Rogerio Feris; Rameswar Panda; Shimon Ullman; Leonid Karlinsky
err分享
err收藏
学者 查看更多内容