返回
Drop2Sparse: Improving Dataset Distillation via Sparse Model
DOI:10.1109/TCSVT.2025.3552047.png)
摘要
En 中文
现代深度学习算法的成功需要大量训练数据,这导致了高昂的计算和存储成本。数据集蒸馏(DD)是一个新兴的研究领域,它通过从大型数据集中合成一个紧凑的训练数据集来解决这一问题。最近的梯度匹配DD方法取得了显著成果。然而,这些方法通常利用弱模型来提升DD性能,而训练良好的模型由于其性能较低,常被视为次优选择。相反,本研究为训练良好模型在DD中的作用提供了新见解,特别是在高存储预算场景下。我们识别出一个此前被忽视的设计原则——模型能力与存储预算之间存在正相关。基于此原则,我们提出了Drop2Sparse,一种通过随机稀疏化训练良好的模型来创建适用于各种存储预算场景的高效模型的方法。Drop2Sparse同时为DD注入显著的模型多样性和正则化效应,在CIFAR上超越以往最佳方法最多3.8%,在ImageNet-subset上超越最多3.6%。此外,我们的方法表现出卓越的跨架构泛化能力,即使在极具挑战性的场景下(如使用极度简化的模型池或高度加速的训练)也能取得有前景的结果。
Keyword:
Dataset compression
dataset distillation
gradient matching
model sparsification
期刊
IF:
11.1
论文数:
845
被引数:
3.1W

