arrow
返回

Less is More: Unlabeled Data Selection for Efficient Tabular Self-supervised Learning

delete2026-08-29
delete0
delete
OA
AI
S
Sintija Stevanoska *
C
Christian L. Camacho Villalón
S
Sašo Džeroski
K
Katharina Dost
DOI:10.1007/s10994-026-07133-8delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
自监督学习(SSL)通过利用大量无标签数据学习可迁移表示来解决标签稀缺问题。然而,在非常大的无标签数据集上进行预训练可能计算成本高昂,并且可能包含噪声或不具代表性的样本,从而降低学习效果。在本文中,我们探讨了是否可以选择可用无标签样本的一个子集用于预文本任务,以降低计算成本,同时保持SSL方法在表格数据上的强性能。具体而言,我们研究了不确定性、多样性和传输性标准是否可以指导这种选择并提高表示质量。为此,我们在25个表格基准数据集上进行了大规模实验,使用了四种SSL模型,并在有偏和无偏标签选择下,对不同程度的有标签数据和无标签数据采样策略进行了测试。为了更好地理解无标签数据子采样的有效性和作用机制,我们通过元分析将数据集特征与实验观察到的性能提升联系起来。我们的结果表明,减少无标签数据池可以在保持甚至提高下游性能的同时,带来显著的计算成本节约。
Keyword:
Self-supervised learning
Tabular data
Unlabeled data selection
Active data selection
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

Machine Learning 封面图
Machine Learning
IF:
2.9
论文数:
2.7K
被引数:
3.4W

机构

J
jožef stefan institute
学者数:
701
论文数: 310
被引数: 0
U
university of canterbury
学者数:
1.2K
论文数: 627
被引数: 0
引用论文

引用论文

Random Forests随机森林
err
IF0
err2001-01-01
err0
PREAI
errLeo Breiman
err分享
err收藏
Self-Supervised Representation Learning: Introduction, advances, and challenges
err2022-05-01
err174
errOAAI
errEricsson, Linus; Gouk, Henry; Loy, Chen Change; Hospedales, Timothy M.
err分享
err收藏
Subset selection for domain adaptive pre-training of language model
err2025-03-19
err0
errOAAI
errHwang, Junha; Lee, Seungdong; Kim, Haneul; Jeong, Young-Seob
err分享
err收藏
Hitting the target: stopping active learning at the cost-based optimum
err2022-10-14
err4
errOAAI
errPullar-Strecker, Zac; Dost, Katharina; Frank, Eibe; Wicker, Joerg
err分享
err收藏
OpenML
err2014-06-16
err0
errOAAI
errJoaquin Vanschoren; Jan N. van Rijn; Bernd Bischl; Luis Torgo
err分享
err收藏
err分享
err收藏
没有更多内容