返回
Statistical Quantile Learning for Large Additive Latent Variable Models
DOI:10.1080/01621459.2025.2526697.png)
摘要
En 中文
来自基因组学、脑成像等领域技术进步的大型复杂数据集,在获取新的科学见解方面展现出巨大潜力。然而,其固有的非线性和高维特性给统计学和机器学习领域带来了显著的理论、方法论和应用挑战。本文介绍了统计分位数学习(SQL)——一种用于估计大型加性潜在变量模型的新型非参数方法。SQL框架的显著特点包括:(i) 一种依赖惩罚和筛子技术的非参数方法:它为深度学习方法提供了一种可扩展且计算简单、但功能强大的替代方案。(ii) 基于统计理论:在温和假设下,SQL在大维情况下是一致的,并达到最优收敛速率。(iii) 适用于大型和高维场景:我们通过数值和理论分析表明,随着数据维度的增加,SQL的性能会得到提升。(iv) 通过可识别的加性模型结构实现可解释性。在阐述理论性质后,我们通过模拟研究证明SQL可以优于变分自编码器(VAE)。最后,我们将SQL应用于高维基因表达数据(包含801个受试者的20,263个基因),所提出的方法识别出可预测五种癌症类型的潜在因子。本文的补充材料可在网上获取,其中包括用于复现工作的材料的标准化描述。
Keyword:
Dimensionality reduction
Generative model
Genomics
High-dimensional inference
Nonparametric estimation
期刊
J
IF:
3
论文数:
5.2K
被引数:
4.8W
机构
引用论文
Molecular Classification of Cancer: Class Discovery and Class Prediction by Gene Expression Monitoring
Science
IF0
MINIMAX RATE OF DISTRIBUTION ESTIMATION ON UNKNOWN SUBMANIFOLDS UNDER ADVERSARIAL LOSSES对抗损失下未知子流形上的极小极大分布率估计
ANNALS OF STATISTICS
IF3.7

