返回
Curriculum Dataset Distillation
DOI:10.1109/TIP.2025.3579228.png)
摘要
En 中文
大多数数据集精炼方法由于巨大的计算和内存需求,难以适应大规模数据集。近期研究开始探索可扩展的解耦方法。然而,在这方面仍然存在性能瓶颈和优化空间。在本文中,我们提出了一种基于课程的数据集精炼框架,旨在调和性能和可扩展性。该框架战略性地精炼合成图像,遵循从简单到复杂的课程。通过引入课程评估,我们解决了先前方法生成图像趋于同质化和简单化的问题,同时以可管理的计算成本实现。此外,我们引入了对合成图像的对抗性优化,以进一步提高其代表性,并防止其过度拟合到参与精炼的神经网络中。这增强了精炼图像在不同神经网络架构上的泛化能力,也提高了其对噪声的鲁棒性。大量实验表明,我们的框架在大规模数据集精炼方面建立了新的基准,在Tiny-ImageNet上实现了11.1%的显著提升,在ImageNet-1K上实现了9.0%的提升,在ImageNet-21K上实现了7.3%的提升。我们的精炼数据集和代码可在https://github.com/MIV-XJTU/CUDD获取。
Keyword:
Dataset distillation
dataset condensation
curriculum learning
期刊
IF:
13.7
论文数:
1.0W
被引数:
8.4W

