返回
Gram-Schmidt Methods for Unsupervised Feature Extraction and Selection
DOI:10.1109/TIT.2025.3589174.png)
摘要
En 中文
在数据存在非线性依赖关系的情况下,特征提取与选择是半监督学习中的一个基本挑战。我们提出在函数空间中使用Gram-Schmidt (GS) 型正交化过程来检测和映射此类依赖关系。具体而言,通过在某个函数族上应用GS过程,我们构建一系列协方差矩阵,这些矩阵可用于识别新的高方差方向,或从已知方向中移除这些依赖关系。在前一种情况下,我们以熵减为标准提供信息论保证;在后一种情况下,我们提供精确条件,以确定所选函数族能够消除数据中现有的冗余。每种方法均提供特征提取和特征选择算法。我们的特征提取方法为线性,可被视为主成分分析(PCA)的自然推广。我们针对合成数据集和真实基准数据集提供了实验结果,结果表明,相比当前最先进(线性)的特征提取和选择算法,我们的方法具有更优性能。令人惊讶的是,我们的线性特征提取算法与自动编码器、核PCA和UMAP等重要非线性特征提取方法相比具有可比性,并且常常表现更优。此外,我们的某一种特征选择算法严格推广了一种基于傅里叶的特征选择机制(Heidari et al., IEEE Transactions on Information Theory, 2022),同时显著降低了复杂度。
Keyword:
Feature extraction
Redundancy
Principal component analysis
Numerical analysis
Covariance matrices
Random variables
Vectors
Data mining
Kernel
Entropy
feature selection
principal component analysis
Gram-Schmidt orthogonalization

