返回
Simple yet Effective Ensemble Feature Selection Using Hierarchical Binning
DOI:10.3390/app16073404.png)
摘要
En 中文
应用亮点 提出的EFSHB框架为高维学习任务提供了稳健且高效的特征选择解决方案。通过基于集成的特征聚合来缓解模型依赖偏差并促进稳定的预测性能,EFSHB特别适用于生物医学基因表达分析、可穿戴传感器和生理信号处理、智能制造系统以及高维工业监测等应用。
摘要 特征选择对于提高高维学习任务的分类性能和减少过拟合至关重要。然而,传统的基于重要性的方法通常存在不稳定性、模型偏差以及对阈值设置的敏感性。为解决这些局限性,我们提出了EFSHB(基于层次分箱的集成特征选择),这是一种集成重要性排序、分箱级贪婪评估、迭代层次细化和基于并集的模型级特征整合的混合集成框架。在每次迭代中,五种基于树的方法独立执行分箱级贪婪选择,并通过并集操作合并其选定的子集,以形成下一次迭代的特征集。这一迭代过程逐步优化特征空间,同时缓解模型特定偏差并促进异构模型间的稳健预测性能。EFSHB在九个高维基准数据集上进行了评估,包括生物医学基因表达、合成、蛋白质组学和语音特征数据。在所有数据集上,EFSHB均实现了最高或接近最高的分类准确率,优于传统的贪婪特征选择(GFS)、基于分箱的GFS(GFSB)和层次分箱GFS(GFSHB)。平均而言,EFSHB提高了所有分类器的准确率,相比GFS和GFSHB分别提升了14.0%和13.3%。EFSHB还通过避免过度保留特征并保留跨模型识别的互补信息特征,实现了平衡的特征缩减。在计算效率方面,EFSHB将平均特征选择时间从266分钟(GFS)缩短至11分钟,实现了24倍的加速。这些结果表明,EFSHB实现了稳健的预测性能和高计算效率,适用于多样化高维应用。
Keyword:
ensemble feature selection
AI-driven data processing
machine learning for data management
high-dimensional data analysis
big data analytics
hierarchical binning
期刊
A
IF:
2.5
论文数:
7.3K
被引数:
4
机构
引用论文
暂无论文信息

