返回
Improving Object Detection Models via LLM-Based Training Data Synthesis
DOI:10.1007/s11263-025-02560-x.png)
摘要
En 中文
尽管深度生成模型取得了显著进展,但为对象检测生成高质量训练数据仍是一项挑战性任务,这主要归因于精确标注的复杂要求和多样化场景的需求。为应对此挑战,我们提出了一种利用大型语言模型(LLMs)生成高质量训练数据的创新框架。首先,我们引入布局增强与多样化图像合成框架(LE-DIS),该框架借助LLMs创建多样化的目标场景,并系统性地构建合成数据。其次,我们提出一种基于CLIP的图像-布局质量度量(CILQM),用于评估合成数据的全局一致性和类别对齐性,以确保输出质量。最后,我们采用一种基于mixup的策略(SRMix),整合合成数据与真实数据,生成多样化的训练样本,从而提升模型的稳定性和适应性。在COCO基准上的大量实验表明,我们的方法显著提升了基于Transformer和基于CNN的对象检测模型的性能,凸显了深度生成模型在为对象检测任务合成高质量数据集方面的潜力。
Keyword:
Dataset Synthesis
Object Detection
Image Generation
Large Language Model
Diffusion Model

