返回
Optimal Transport-based Difficulty-aware Contribution Allocation for Dataset Distillation
DOI:10.1109/tpami.2026.3730301.png)
摘要
En 中文
对大规模数据集的日益依赖给深度学习模型训练带来了显著的存储和计算负担。数据集蒸馏方法,特别是基于样本生成的方法,旨在将大型原始数据集压缩成紧凑的合成集,同时保留关键信息。现有子集合成方法通常最小化同质距离,将所有真实样本对每个合成样本的贡献均等分配。我们表明,这种均等分配忽略了真实-合成样本对之间的实例级关系,导致对蒸馏数据集与原始数据集之间几何结构差异的建模不足。在本文中,我们将同质距离最小化重新表述为一个双层优化问题,采用匹配-近似范式。在匹配阶段,我们使用最优传输矩阵动态分配真实样本的贡献。在此基础上,我们进一步引入一个难易度感知的边际重加权机制,以强调信息量大的样本,同时保持全局几何一致性。在随后的近似阶段,合成样本根据建立的分配方案进行优化,以更好地逼近真实数据分布。该策略能够更准确地刻画复杂的几何结构,并增强对类内变化的处理,从而提高蒸馏保真度。在多种架构、模态和学习范式上的广泛实验表明,所提出的框架能够持续提升性能,在标准监督学习、联邦学习、持续学习和多模态学习等设置中均观察到性能提升。
Keyword:
Dataset Distillation
Optimal Transport
Sinkhorn Normalization

