返回
Genetic algorithms in feature and instance selection
DOI:10.1016/j.knosys.2012.11.005.png)
摘要
En 中文
特征选择和实例选择是数据挖掘中两个重要的数据预处理步骤,前者旨在从给定的数据集中删除一些不相关和/或冗余的特征,后者旨在丢弃错误的数据。在相关研究中,遗传算法已广泛用于这些任务。然而,这两个数据预处理任务通常在文献中单独考虑。当单独执行特征和实例选择以及特征或实例选择时,性能差异是未知的。因此,本研究的目的是执行基于遗传算法的特征选择和实例选择,使用不同的优先级来检查不同领域数据集的分类性能。从包含各种数量的特征和数据样本的四个小型和大型数据集获得的实验结果表明,同时执行特征和实例选择通常会使分类器 (即支持向量机和k-最近邻) 的性能比单独的特征选择或实例选择稍差。然而,尽管这些不同的数据预处理方法之间的分类精度没有显著差异,但与单独执行特征和实例选择相反,特征和实例选择的组合大大减少了训练分类器的计算工作量。考虑到分类的有效性和效率,我们证明了首先进行特征选择和其次进行实例选择是数据挖掘中数据预处理的最佳解决方案。SVM和k-nn分类器都提供与基线 (即没有数据预处理的基线) 相似的分类精度。还讨论了针对不同数据集规模执行哪个数据预处理任务的决定。(C)2012 Elsevier B.V. 版权所有。
Keyword:
Genetic algorithms
Feature selection
Instance selection
Data mining
Data preprocessing
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
K
IF:
7.6
论文数:
1.2W
被引数:
4.5W
机构
引用论文
Understanding physical activity and sedentary behaviour among preschool-aged children in Singapore: a mixed-methods approach
BMJ Open
IF0

