返回
Tabular Data Distillation: An Extensive Comparison
DOI:10.3390/make8040084.png)
摘要
En 中文
本文提出了一种针对下游分类和回归任务的表格数据蒸馏方法的全面评估。我们的分析考虑了多种与问题类型无关(即无监督)的蒸馏方法。对于下游学习器,我们专注于非神经网络模型,如随机森林、XGBoost和支持向量机,因为我们的目标是独立于学习器评估蒸馏数据的质量。评估在17个分类问题和9个回归问题上进行。我们的发现总结如下:(1) 在所有情况下,应用蒸馏方法与基线相比会导致性能下降;(2) 总体而言,基于coreset的方法最为有效,其性能损失最小——从分类准确率或回归相关性的约3%到某些情况下可忽略不计;(3) 性能损失与数据集尾部特征(以异常值比例为衡量标准)中度相关;(4) 所有蒸馏方法都会改变数据集的一致性,缩小能产生良好性能的超参数值范围;(5) Coreset Leverage Score保持快速,无论原始集和蒸馏集的大小如何。
Keyword:
tabular data distillation
coreset
distribution matching
classification
regression
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
M
IF:
6
论文数:
818
被引数:
1.8K

