返回
Not another imputation method: A transformer-based model for missing values in tabular datasets
DOI:10.1016/j.aiopen.2026.02.005.png)
摘要
En 中文
表格数据集中缺失值的处理在训练和测试人工智能模型时是一个重大挑战,这一问题通常通过插补技术来解决。本文介绍了“Not Another Imputation Method”(NAIM)模型,这是一种基于转换器的新型模型,专门设计用于解决此问题,而无需传统的插补技术。NAIM能够避免插补缺失值的必要性并有效学习可用数据,依赖于两种主要技术:使用特征特定嵌入来编码类别和数值特征,同时处理缺失输入;修改掩码自注意力机制以完全屏蔽缺失数据的贡献。此外,引入了一种新颖的正则化技术以增强模型从不完整数据中泛化的能力。我们在5个公开可用的表格数据集上全面评估了NAIM,证明其性能优于6种最先进的机器学习模型和5种深度学习模型,这些模型在必要时均与3种不同的插补技术配对。结果表明,NAIM在提高预测性能和增强在缺失数据存在下的鲁棒性方面具有显著效果。为促进进一步研究和在无传统插补方法的情况下处理缺失数据的实际应用,我们已将NAIM的代码发布在https://github.com/cosbidev/NAIM。
Keyword:
Missing data
Imputation
Tabular embedding
Attention mechanism
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
A
IF:
14.8
论文数:
11
被引数:
0
机构
引用论文
MARIA: A multimodal transformer model for incomplete healthcare dataMARIA:一种用于不完整医疗数据的跨模态Transformer模型
Class imbalance should not throw you off balance: Choosing the right classifiers and performance metrics for brain decoding with imbalanced data
NeuroImage
IF0
Handling missing values in healthcare data: A systematic review of deep learning-based imputation techniques处理医疗保健数据中的缺失值: 基于深度学习的插补技术的系统综述
A systematic review of intermediate fusion in multimodal deep learning for biomedical applications多模态深度学习中用于生物医学应用的中间融合的系统综述
Long-term outcomes from pembrolizumab monotherapy in patients with advanced NSCLC, PD-L1 expression ≥ 50 %, and poor performance status: Transformer-based AI to characterize prognostic complexity长期接受帕博利珠单抗单药治疗的患者中,具有晚期非小细胞肺癌、PD-L1表达≥50%且体力状况较差者的长期结局:基于Transformer的AI用于表征预后复杂性
Lung Cancer
IF4.4

