返回
Correlation-based feature selection of single cell transcriptomics data from multiple sources
DOI:10.1186/s40537-024-01051-z.png)
摘要
En 中文
在将数据挖掘或机器学习技术应用于大型且多样化的数据集时,通常需要构建描述性和预测性模型。描述性模型用于发现数据属性之间的关系,而预测性模型则识别未来将收集的数据特征。生物信息学数据具有高维性,这使得实际上不可能将大多数经典分类和聚类算法应用于其中。即使算法有用,使用大型多维数据进行训练会显著增加处理时间。专门用于处理高维数据的算法通常无法处理包含数千维度(特征)的大型数据集。降维方法(如PCA)无法提供令人满意的结果,并且还会模糊数据中原始属性的含义。为了使构建的模型可用,它们必须满足可扩展性要求,因为生物信息学数据的量正在迅速增加。此外,不同来源的数据特征的重要性可能存在差异。本文描述了一种用于高效分类高维(30,698)转录组学数据的属性选择方法。该方法已使用22种分类算法进行了测试。所选属性集的分类结果与完整属性集的结果相当。
Keyword:
Feature selection
High-dimensional data
Classification
Transcriptomics data
期刊
IF:
6.4
论文数:
1.5K
被引数:
1.1W
机构
暂无机构信息
引用论文
Classification of PBMC cell types using scRNAseq, ANN, and incremental learning使用单细胞RNA测序、人工神经网络和增量学习对PBMC细胞类型进行分类
Classification of Five Cell Types from PBMC Samples using Single Cell Transcriptomics and Artificial Neural Networks使用单细胞转录组学和人工神经网络对五种细胞类型进行分类,源自PBMC样本。

