arrow
返回

Visual relation-aware and knowledge-guided multi-modal relation extraction

delete2025-10-16
delete0
PRE
AI
C
Chuncheng Lu
T
Tianran Chen
D
Duo Shang *
J
Jun Luo
X
Xin Hui
R
R. S. Shi
DOI:10.1007/s10586-025-05731-0delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
多模态关系抽取(MRE)旨在通过利用关联的视觉信息来识别文本中实体之间的语义关系。虽然现有方法已取得进展,但它们存在两个关键局限性:(1) 忽略了提供关键上下文线索的对象间细粒度视觉关系,以及(2) 未能利用可能增强实体和文本上下文理解的外部知识。为解决这些挑战,我们提出了DGF-PT,一种将视觉关系和多粒度知识集成到MRE中的新型框架。我们的方法首先通过场景图对齐视觉对象和文本标记,构建统一的跨模态图,其中显式建模了多种关系(例如空间关系、基于动作的关系)。随后,关系感知Transformer在图中传播信息,同时保留模态特定和跨模态交互。此外,我们采用大型语言模型(LLMs)生成实体级描述和句子级解释,并通过交叉注意力选择性地融合这些信息以丰富文本表示。在MNRE基准测试上的实验表明,DGF-PT取得了85.26%的F1分数,达到当前最优性能,较先前方法提升了2.71%。
Keyword:
Multi-modal relation extraction
Visual relations
Scene graphs
Large language models

期刊

C
Cluster Computing
IF:
0
论文数:
691
被引数:
1

机构

暂无机构信息
引用论文

引用论文

暂无论文信息