返回
Random k conditional nearest neighbor for high-dimensional data
DOI:10.7717/peerj-cs.2497.png)
摘要
En 中文
k近邻(kNN)方法是一种简单有效的分类算法,已有多种基于kNN算法的变体被提出。kNN的一个局限性在于,当数据包含许多噪声特征时,由于这些特征在计算距离时具有非信息性影响,该方法可能效果不佳。此外,在高维数据中,从最近邻中获取的信息可能意义不大。为解决基于最近邻的方法在高维数据中的局限性,我们提出扩展k条件近邻(kCNN)方法,这是一种有效的kNN变体。所提方法聚合多个kCNN分类器,每个分类器均由随机采样的特征子集构建。我们还开发了一种评分指标,根据特征子集的分离程度为单个分类器赋权。我们通过模拟研究了所提方法的性质。此外,基因表达数据集上的实验表明,所提方法在预测分类性能方面具有前景。
Keyword:
K nearest neighbor
High-dimensional data
Nonparametric classification
期刊
IF:
2.5
论文数:
3.4K
被引数:
6.9K
机构
引用论文
A study of the effect of different types of noise on the precision of supervised learning techniques

