返回
Categorical variable encoding methods for tabular data: a benchmarking study
DOI:10.1007/s41060-025-00886-w.png)
摘要
En 中文
机器学习模型通常需要数值输入,这使得对分类特征的编码成为数据预处理流程中的关键步骤。现有多种编码方法,如常用的独热编码(one-hot encoding),但这些方法可能并非总是最优的,因为它们会增加维度,且对类别间的固有关系缺乏敏感性。本文对26种分类编码技术进行了全面评估,并在13个真实数据集和7种不同机器学习算法上进行基准测试。本研究根据预测任务类型、模型性能和计算效率对这些方法进行分类,为编码器的选择提供了分类体系。此外,我们阐述了如何将Safe AI指标应用于编码流程,表明它们能提供关于模型鲁棒性和公平性的补充见解。最后,我们提供了一个名为EncodeHero的Python工具,使研究者和实践者能够(1)通过补充自有数据扩展基准结果;(2)根据其数据和技术的约束条件选择最佳编码方法。
Keyword:
Variable encoding
Categorical data
Tabular data
期刊
I
IF:
2.8
论文数:
1.1K
被引数:
1.3K
机构
引用论文
Generalized Feature Embedding for Supervised, Unsupervised, and Online Learning Tasks用于监督,无监督和在线学习任务的广义特征嵌入
Effective Methods of Categorical Data Encoding for Artificial Intelligence Algorithms人工智能算法中分类数据编码的有效方法
Mathematics
IF0

