返回
Federated semi-supervised learning with diffusion model-based data synthesis
DOI:10.23919/JCC.fa.2024-0672.202507.png)
摘要
En 中文
联邦半监督学习(FSSL)面临两大主要挑战:各客户端间标注数据的稀缺性以及客户端间数据非独立同分布(Non-IID)的特性。为解决这些问题,我们提出了基于扩散模型的数据合成辅助联邦半监督学习(DDSA-FSSL),这是一种新颖的方法,利用扩散模型(DM)生成合成数据,从而弥合异构本地数据分布与全局数据分布之间的差距。在所提出的DDSA-FSSL中,每个客户端通过利用联邦学习训练的分类器对未标注数据进行伪标注,以应对标注数据的稀缺问题。随后,扩散模型使用标注数据和精度优化的伪标注数据进行协同训练,使客户端能够为本地标注数据集中缺失的类别生成合成样本。结果,本地分布与全局分布之间的差异得以降低,客户端能够创建与全局数据分布更一致的丰富合成数据集。在多种数据集和非独立同分布场景下的广泛实验证明了DDSA-FSSL的有效性,实现了显著性能提升,例如在CIFAR-10数据集上标注数据占比10%时,准确率从38.46%提升至52.14%。
Keyword:
diffusion model
federated semi-supervised learning
non-independent and identically distributed

