返回
Conformalised data synthesis
DOI:10.1007/s10994-024-06701-0.png)
摘要
En 中文
随着日益复杂的深度学习架构的普及,数据合成是一种极具前景的技术,用于满足对数据需求量大的模型的需求。然而,可靠地评估“合成器”模型输出的质量是一个开放的研究问题,在高风险领域存在显著的相关风险。为应对这一挑战,我们提出了一种独特的合成算法,该算法基于一致性预测(Conformal Prediction)框架,从高置信度特征空间区域生成数据。我们通过全面探讨核心参数的影响、深入讨论实用建议以及对五个基准数据集的广泛实证评估来支持我们提出的算法。为展示我们方法在普遍存在的现实世界挑战中的通用性,所选数据集因其多样化的困难特征而经过精心挑选:样本量少、类别不平衡和非可分性。在所有试验中,使用我们自信合成的数据扩展后的训练集,其表现至少与原始数据集相当,并且经常通过F1-score最高提升61个百分点显著改善了深度学习性能。
Keyword:
Conformal prediction
Uncertainty quantification
Statistical confidence
Synthetic data
Data generation
期刊
IF:
2.9
论文数:
2.7K
被引数:
3.4W
机构
引用论文
Synergy conformal prediction applied to large-scale bioactivity datasets and in federated learning协同保形预测应用于大规模生物活性数据集和联合学习
Evaluating Synthetic Medical Images Using Artificial Intelligence with the GAN Algorithm
SENSORS
IF3.5

