arrow
返回

Representation Retrieval Learning for Heterogeneous Data Integration

delete2026-09-08
delete0
delete
OA
AI
Q
Qi Xu
A
Annie Qu *
DOI:10.1080/01621459.2026.2696485delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
在大数据时代,大规模、多源、多模态数据集日益普遍,为预测建模和科学发现提供了前所未有的机遇。然而,这些数据集通常表现出复杂的异质性,如协变量偏移、后验漂移和块状缺失,这些因素会降低现有监督学习算法的预测性能。为同时应对这些挑战,我们提出了一种新的表示检索(R²)框架,该框架整合了表示学习模块字典(表示者字典)与数据源特定的稀疏诱导机器学习模型(学习器)。在该R²框架下,我们引入了每个表示者的“整合性”概念,并提出了一种新的“选择性整合惩罚”(SIP),以明确鼓励更具整合性的表示者来提升预测性能。理论上,我们证明R²框架的过剩风险界由表示者的整合性决定,而SIP有效改善了过剩风险。广泛的模拟研究验证了R²框架及其SIP的优越性能。我们进一步将该方法应用于两个真实数据集,以确认其经验上的成功。本文的补充材料可在网上获取,包括用于复现工作的标准化材料描述。
Keyword:
Blockwise missing data
Excess risk bound
Multi-modality data
Multi-task learning
Representation learning

期刊

J
Journal of the American Statistical Association
IF:
3
论文数:
5.2K
被引数:
4.8W

机构

C
carnegie mellon university
学者数:
2.1K
论文数: 991
被引数: 0
引用论文

引用论文

暂无论文信息