返回
Difference-Aware Multi-Grained Feature Learning With Memory-Attended Joint Interaction Transformer for Image Difference Captioning
DOI:10.1109/tpami.2026.3736459.png)
摘要
En 中文
图像差异描述(IDC)旨在使用自然语言描述一对相似图像之间的语义变化。大多数现有方法依赖于现成的视觉骨干网络来提取图像对的特征。然而,这些骨干网络是为单图像理解预训练的,往往难以捕捉两幅图像之间的细微差异。因此,提取的特征对IDC效果不佳。在本文中,我们提出了一种两阶段训练范式用于IDC。在第一阶段,我们设计了差异感知的多粒度特征学习(DAMFEL),通过联合建模图像对与标题之间的粗粒度和细粒度对比对齐,来适应预训练的CLIP模型用于IDC。该范式使模型能够充分捕捉图像对的差异感知特征。在第二阶段,基于这些特征,我们设计了一种基于记忆关注的联合交互Transformer(MAJIT)用于标题生成。MAJIT在(i)用于感知视觉变化的跨图像交互和(ii)用于将这些变化锚定到生成词的跨模态交互之间建立了协同作用。在每个解码步骤中,MAJIT采用可学习的三重共享记忆来记录两幅图像和部分生成标题之间的共享信息,使两种交互的结果能够相互补充和增强。在四个公开的IDC基准测试上的实验表明,该方法在不同变化场景下表现出较强的性能,与轻量级方法相比具有一致的优势,并且相对于基于MLLM的方法取得了有竞争力的结果。
Keyword:
Difference-aware multi-grained feature learning
image difference captioning
memory-attended joint interaction transformer

