返回
Representation Learning for Tabular Data: A Comprehensive Survey
DOI:10.1109/TPAMI.2026.3657217.png)
摘要
En 中文
表格数据,以行和列的结构化形式,是机器学习分类和回归应用中最常见的数据类型之一。从表格数据中学习的模型不断发展,深度神经网络(DNNs)最近通过其表示学习能力显示出有前景的结果。在这篇综述中,我们系统地介绍了表格表示学习领域,涵盖了背景、挑战和基准,以及使用DNNs的优缺点。我们根据它们的一般化能力将现有方法分为三大类:专用模型、可迁移模型和通用模型。专用模型专注于训练和评估在同一数据分布中进行的任务。我们基于表格数据的关键方面——特征、样本和目标——引入了一个分层分类法,并深入探讨了获取高质量特征级和样本级表示的详细策略。可迁移模型在一个或多个数据集上进行预训练,然后在下游任务上进行微调,利用从同质或异构来源,甚至跨模态(如视觉和语言)获取的知识。通用模型,也称为表格基础模型,进一步扩展了这一概念,允许直接应用于下游任务而无需额外微调。我们根据这些通用模型在异构数据集之间适应所使用的策略对其进行分组。此外,我们探讨了集成方法,这些方法整合了多个表格模型的优点。最后,我们讨论了表格学习的代表性扩展,包括开放环境下的表格机器学习、表格数据的多模态学习以及表格理解任务。
Keyword:
Tabular data
representation learning
deep tabular learning
tabular foundation model
期刊
IF:
18.6
论文数:
1.0K
被引数:
9.8W

