返回
Less is More: Unlabeled Data Selection for Efficient Tabular Self-supervised Learning
DOI:10.1007/s10994-026-07133-8.png)
摘要
En 中文
自监督学习(SSL)通过利用大量无标签数据学习可迁移表示来解决标签稀缺问题。然而,在非常大的无标签数据集上进行预训练可能计算成本高昂,并且可能包含噪声或不具代表性的样本,从而降低学习效果。在本文中,我们探讨了是否可以选择可用无标签样本的一个子集用于预文本任务,以降低计算成本,同时保持SSL方法在表格数据上的强性能。具体而言,我们研究了不确定性、多样性和传输性标准是否可以指导这种选择并提高表示质量。为此,我们在25个表格基准数据集上进行了大规模实验,使用了四种SSL模型,并在有偏和无偏标签选择下,对不同程度的有标签数据和无标签数据采样策略进行了测试。为了更好地理解无标签数据子采样的有效性和作用机制,我们通过元分析将数据集特征与实验观察到的性能提升联系起来。我们的结果表明,减少无标签数据池可以在保持甚至提高下游性能的同时,带来显著的计算成本节约。
Keyword:
Self-supervised learning
Tabular data
Unlabeled data selection
Active data selection
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
2.9
论文数:
2.7K
被引数:
3.4W

