返回
TIMF: TabPFN-integrated multimodal framework for robust tabular-image learning
DOI:10.1016/j.neucom.2026.134975.png)
摘要
En 中文
表格-图像多模态学习,将结构化表格数据与图像数据相结合,在现实应用中,尤其是在医疗保健领域具有显著前景。然而,仍存在两个基本挑战:(1) 与视觉和语言领域不同,表格数据缺乏标准化的预训练表示;(2) 表格输入中缺失值的普遍存在,使得实际中可靠的多模态融合变得复杂。为解决这些挑战,我们提出了表格-图像多模态融合框架(TIMF),该框架利用TabPFN作为预训练的表格基础编码器,并将其与预训练图像骨干网络的视觉表示相结合。通过使用TabPFN作为冻结的表格编码器,TIMF能够生成鲁棒且信息丰富的表格嵌入,自然处理缺失值,并在数据有限的情况下具有良好的泛化能力。我们系统地研究了不同的融合策略和表格编码器,并在自然和医学多模态数据集上评估了TIMF。实验结果表明,TIMF在不同缺失程度下均能稳定超越基线方法,凸显了预训练表格表示在多模态学习中的有效性。

