返回
SVPDSA: Selective View Perception Data Synthesis With Annotations Using Lightweight Diffusion Network
DOI:10.1109/ACCESS.2025.3588542.png)
摘要
En 中文
高质量标注图像数据集的生成,在低计算成本和自动化标注的前提下,对于推动计算机视觉系统的发展至关重要。然而,真实图像的手动标注通常需要大量人力且成本高昂。为克服这些挑战,提出了一种名为SVPDSA的通用数据集生成模型,该模型整合了残差与注意力模块剪枝、减少采样步骤和网络量化等技术。该模型包含两个主要训练阶段:Refined LDM(潜在扩散模型)的重新训练和P-Decoder(感知解码器)的训练。一个基于Unet的压缩扩散模型,预训练于LAION-5B数据集,作为高效文本到图像合成的基石。该模型训练约50,000次迭代,学习率为0.0001,确保了轻量级且有效的生成。所提出的模型能够高效生成多样化的合成图像,并附带高质量的感知标注。该方法利用轻量级训练的扩散模型,将文本引导的图像合成扩展至感知数据生成,在保证生成数据集质量的同时,提供了一种灵活的标注生成方案。引入一个解码器模块以扩展潜在编码特征,并为语义分割、实例分割和深度估计等任务生成标注注释。解码器的训练仅需少于100张手动标注图像,即可创建无限大的标注数据集。在Cityscapes数据集上的评估表明,SVPDSA在车辆、公交车和自行车等关键对象类别上,与Mask2Former和DatasetDM等现有方法持平或超越。其使用仅9张真实图像和38k合成样本,与ResNet-50结合时达到42.7的mIoU,与Swin-B结合时达到41.4的mIoU,展示了其在极少量真实数据下生成高质量标注的高效性。将所提出的模型部署于边缘设备上,推理时间少于5秒。本研究为构建适用于受限训练环境的资源高效数据生成系统做出了贡献。
Keyword:
Annotation generation
computer vision
depth estimation
diffusion model
edge deployment
instance segmentation
semantic segmentation
synthetic datasets
期刊
IF:
3.6
论文数:
9.8W
被引数:
29.4W
机构
引用论文
Diffuse, Attend, and Segment: Unsupervised Zero-Shot Segmentation using Stable Diffusion扩散、关注和分割:基于Stable Diffusion的无监督零样本分割

