arrow
返回

Tabular Data Distillation: An Extensive Comparison

delete2026-03-26
delete0
delete
OA
AI
C
Corneliu Florea *
E
Eduard Barnoviciu
DOI:10.3390/make8040084delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
本文提出了一种针对下游分类和回归任务的表格数据蒸馏方法的全面评估。我们的分析考虑了多种与问题类型无关(即无监督)的蒸馏方法。对于下游学习器,我们专注于非神经网络模型,如随机森林、XGBoost和支持向量机,因为我们的目标是独立于学习器评估蒸馏数据的质量。评估在17个分类问题和9个回归问题上进行。我们的发现总结如下:(1) 在所有情况下,应用蒸馏方法与基线相比会导致性能下降;(2) 总体而言,基于coreset的方法最为有效,其性能损失最小——从分类准确率或回归相关性的约3%到某些情况下可忽略不计;(3) 性能损失与数据集尾部特征(以异常值比例为衡量标准)中度相关;(4) 所有蒸馏方法都会改变数据集的一致性,缩小能产生良好性能的超参数值范围;(5) Coreset Leverage Score保持快速,无论原始集和蒸馏集的大小如何。
Keyword:
tabular data distillation
coreset
distribution matching
classification
regression
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

M
Machine Learning and Knowledge Extraction
IF:
6
论文数:
818
被引数:
1.8K

机构

引用论文

引用论文

A topological proof of Sklar’s theorem
err2013-09-01
err0
errOAAI
errFabrizio Durante; Juan Fernández-Sánchez; Carlo Sempi
err分享
err收藏
A comparative analysis of gradient boosting algorithms梯度提升算法的比较分析
err2020-08-24
err863
errOAAI
errBentejac, Candice; Csorgo, Anna; Martinez-Munoz, Gonzalo
err分享
err收藏
学者 查看更多内容