返回
Multi-Perspective Cross-Modal Object Encoding for Referring Expression Comprehension
DOI:10.1109/TIP.2025.3620129.png)
摘要
En 中文
指代表达式理解(REC)是理解给定文本描述如何在图像中识别目标对象的关键任务。现有的两阶段REC方法因其合理的框架设计而表现出强大的性能。然而,在编码图像中的候选对象时,大多数两阶段方法完全依赖预训练检测器提取的特征,往往忽视了对象与其邻近元素之间的上下文关系。这一局限性阻碍了对上下文和关系信息的全面捕捉,降低了对象表征的判别力,并对后续处理产生负面影响。本文提出两种新颖的即插即用模块:表达式引导的标签表征模块(ELR)和跨模态校准语义模块(CCS),旨在增强两阶段REC方法。具体而言,ELR模块将表达式中的名词短语与图像中候选对象的类别标签相连接,确保它们之间的有效对齐。在这些连接的引导下,引入CCS模块通过整合来自多个视角的自身特征与邻近候选对象的特征来表征每个候选对象。这既保留了每个候选对象的固有信息,又融入了其他对象的关系线索,从而实现更精确的嵌入以及两阶段REC方法中的有效下游处理。在六个数据集上的广泛实验证明了引入先验统计知识的重要性,详细分析表明所提出的模块强化了图像与文本之间的对齐。因此,我们的方法取得了具有竞争力的性能,并且与REC任务中的大多数两阶段方法兼容。代码可在Github上获取:https://github.com/freedom6927/ELR_CCS.git。
Keyword:
Referring expression comprehension
expression-guided label representation module
cross-modal calibrated semantic module

