返回
SMIR: Span-based multi-grained information refinement for joint multimodal entity-relation extraction
DOI:10.1016/j.ipm.2026.104687.png)
摘要
En 中文
多模态命名实体识别和多模态关系抽取是知识图谱构建中的两个关键子任务。传统流水线框架将这两个任务分开处理,忽略了它们之间的相互支持。最近,针对联合多模态实体-关系抽取(JMERE),提出了基于词对关系标注的框架。然而,这些方法忽视了实体内部词语间的相互理解。为此,我们主张在JMERE中关注文本片段(spans)而非词语来解决这一问题。然而,在JMERE中关注文本片段并非易事,这将面临信息粗糙和信息冗余的挑战。因此,本文提出了一种新颖的基于文本片段的多粒度信息精炼(SMIR)框架以应对这些挑战。具体而言,我们首先构建文本片段表示矩阵,替代词对关系标注。然后,我们提出一个多粒度信息精炼模块来应对信息粗糙的挑战,涵盖全局样本精炼、局部视觉精炼和局部片段精炼,为文本片段提供更精确和全面的信息。最后,为解决信息冗余问题,我们设计了一种基于文本片段的跨模态融合方法,以整合与文本片段相关的异构多模态信息。在JMERE数据集上的实验结果表明,我们的SMIR框架的有效性,其F1分数相较于现有最优JMERE方法提升了2.09%。
Keyword:
Span-based learning
Multimodal named entity recognition
Multimodal relation extraction
Information refinement
Joint extraction
期刊
I
IF:
6.9
论文数:
549
被引数:
0
机构
引用论文
Multi-granularity cross-modal representation learning for named entity recognition on social media面向社交媒体命名实体识别的多粒度跨模态表示学习
Text-Image Scene Graph Fusion for Multimodal Named Entity RecognitionCheng, J.; Long, K.; Zhang, S.; Zhang, T.; Ma, L.; Cheng, S.; Guo, Y. 文本-图像场景图融合用于多模态命名实体识别. IEEE Trans. Artif. Intell. 2023, 5, 2828–2839. [Google Scholar] [CrossRef]
Enhancing Multimodal Entity and Relation Extraction With Variational Information Bottleneck利用变分信息瓶颈增强多模态实体和关系抽取
Object-Aware Multimodal Named Entity Recognition in Social Media Posts With Adversarial Learning具有对抗学习的社交媒体帖子中的对象感知多模态命名实体识别
The more quality information the better: Hierarchical generation of multi-evidence alignment and fusion model for multimodal entity and relation extraction质量信息越多越好: 多模态实体和关系抽取的多证据对齐与融合模型的分层生成

