arrow
返回

Interactive Visual Cue Refinement for Multi-modal Named Entity Recognition

delete2026-01-01
delete0
PRE
AI
B
Bai, Yu *
W
Wang, Lianji
L
Liu, Xiang
Z
Zhang, Guiping
DOI:10.1007/978-981-95-5640-3_31delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
随着社交媒体平台上多模态数据的持续增长,传统的命名实体识别已不足以处理当代数据格式。因此,研究人员提出了多模态命名实体识别(MNER)。现有研究侧重于捕获与实体对应的视觉区域以辅助实体识别。然而,这些方法仍难以缓解与实体无关的视觉区域的干扰。为解决此问题,我们提出了一种新颖的框架——交互式视觉提示精炼(IVCR)用于MNER,以准确捕获与实体关联的视觉提示(对象级视觉区域)。我们利用提示来表示实体类别的语义信息,这有助于评估视觉提示并减少与实体无关的干扰。此外,我们设计了一个交互式Transformer,分两阶段运行:首先在每种模态内部,然后在模态之间——通过学习冻结的视觉编码器来精炼视觉提示,从而减少文本和视觉模态之间的差异。在Twitter15和Twitter17两个公开数据集上进行了全面实验。结果和详细分析表明,我们的方法表现出稳健且具有竞争力的性能。
Keyword:
Multi-modal Named Entity Recognition
Multi-modal Interaction
Prompt Learning
Transformer

期刊

W
WEB AND BIG DATA, APWEB-WAIM 2025, PT I
IF:
0
论文数:
32
被引数:
0

机构

S
shenyang aerospace university
学者数:
1.4K
论文数: 460
被引数: 0
引用论文

引用论文

err
IF0
err
err0
PREAI
err
err分享
err收藏
err分享
err收藏
学者 查看更多内容