返回
A Simple Interactive Attention for Multimodal Named Entity Recognition
DOI:10.1007/978-981-96-7008-6_8.png)
摘要
En 中文
多模态命名实体识别(MNER)将视觉和文本数据相结合,以对句子中的命名实体进行分类。MNER的一个挑战在于将文本实体与相关视觉区域对齐,同时最小化无关视觉区域的干扰。针对这一挑战,现有方法使用辅助模型提取视觉信息。然而,这些模型提取的视觉信息通常仍包含对实体识别无关的数据,同时增加了模型的计算复杂度。为解决这些问题,我们提出了一个用于MNER的简单交互式注意力机制(SIAM NER),避免了使用额外的辅助模型。具体而言,我们开发了一种交互式注意力机制,利用文本和视觉模态之间的双向交互,精确地将实体词与图像区域对齐,从而最小化无关视觉信息的干扰。此外,我们集成了一个门控机制来调整模态权重,在对应视觉数据缺失时有效减少视觉干扰。综合实验表明,我们的方法在有效性和效率方面均优于现有的基线方法。代码可在SIAMNER获取。
Keyword:
Multimodal Named Entity Recognition
Interaction Attention
Information Extraction
期刊
N
IF:
0
论文数:
24
被引数:
0
机构
引用论文
MAF: A General Matching and Alignment Framework for Multimodal Named Entity RecognitionMAF: 多模态命名实体识别的通用匹配和对齐框架

