返回
Fusion-Enhanced Bidirectional Multimodal Entity Linking Model
DOI:10.1016/j.engappai.2026.116106.png)
摘要
En 中文
多模态知识图谱依赖多模态实体链接(MEL)将跨模态的实体提及与结构化知识库对齐。然而,现有MEL方法在复杂现实场景中面临严峻挑战,主要由于异质模态间的语义鸿沟、严重的文本噪声以及多个非显著视觉实体的存在。传统方法依赖无差别的特征融合或端到端的生成式大型语言模型(LLMs),缺乏明确的跨模态噪声传播抑制机制,导致其易产生幻觉和表征退化。为解决这些关键局限,我们提出融合增强的双向多模态实体链接模型(FILLED),旨在系统整合特征增强、动态评估和噪声蒸馏。具体而言,该框架引入:(i) 特征金字塔双向融合网络以丰富视觉表征;(ii) 词语感知文本编码器以捕捉多粒度语义;(iii) LLM引导的动态门控机制以明确评估模态特异性信噪比;(iv) 经对比学习优化的瓶颈融合模块,用于执行物理噪声过滤并强制跨模态语义一致性。在三个基准数据集(Wiki-MEL、WikiDiverse和Noisy-MEL)上的广泛实验表明,FILLED在标准语料上取得有竞争力的性能,并在极端干扰的Noisy-MEL数据集上创下新的最佳结果。值得注意的是,在高度扰动的噪声子集上,FILLED达到57.8%的Top-1准确率和83.6%的Mean Reciprocal Rank(MRR),分别超越最强基线3.2%和1.1%。这些指标证实了所提模型在高度噪声环境下的卓越鲁棒性和长尾消歧能力。
期刊
IF:
8
论文数:
5.7K
被引数:
3.5W
机构
引用论文
暂无论文信息

