arrow
返回

Improving Object Detection Models via LLM-Based Training Data Synthesis

delete2025-09-10
delete0
PRE
AI
S
Shi-Ran Ge *
J
Jie Cao *
R
Ran He
DOI:10.1007/s11263-025-02560-xdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
尽管深度生成模型取得了显著进展,但为对象检测生成高质量训练数据仍是一项挑战性任务,这主要归因于精确标注的复杂要求和多样化场景的需求。为应对此挑战,我们提出了一种利用大型语言模型(LLMs)生成高质量训练数据的创新框架。首先,我们引入布局增强与多样化图像合成框架(LE-DIS),该框架借助LLMs创建多样化的目标场景,并系统性地构建合成数据。其次,我们提出一种基于CLIP的图像-布局质量度量(CILQM),用于评估合成数据的全局一致性和类别对齐性,以确保输出质量。最后,我们采用一种基于mixup的策略(SRMix),整合合成数据与真实数据,生成多样化的训练样本,从而提升模型的稳定性和适应性。在COCO基准上的大量实验表明,我们的方法显著提升了基于Transformer和基于CNN的对象检测模型的性能,凸显了深度生成模型在为对象检测任务合成高质量数据集方面的潜力。
Keyword:
Dataset Synthesis
Object Detection
Image Generation
Large Language Model
Diffusion Model

期刊

International Journal of Computer Vision 封面图
International Journal of Computer Vision
IF:
9.3
论文数:
3.9K
被引数:
2.8W

机构

I
Institute of Automation
学者数:
539
论文数: 287
被引数: 220
引用论文

引用论文

A Survey on Evaluation of Large Language Models大型语言模型评价研究综述
err2024-03-29
err232
errOAAI
errChang, Yupeng; Wang, Xu; Wang, Jindong; Wu, Yuan; Yang, Linyi; Zhu, Kaijie; Chen, Hao; Yi, Xiaoyuan; Wang, Cunxiang; Wang, Yidong; Ye, Wei; Zhang, Yue; Chang, Yi; Yu, Philip S.; Yang, Qiang; Xie, Xing
err分享
err收藏
err分享
err收藏
Image Generation: A Review图像生成: 回顾
err2022-03-11
err0
PREAI
errMohamed Elasri; Omar Elharrouss; Somaya Al-Maadeed; Hamid Tairi
err分享
err收藏
Layout2image: Image Generation from Layout
err2020-02-24
err11
errOAAI
errZhao, Bo; Yin, Weidong; Meng, Lili; Sigal, Leonid
err分享
err收藏