返回
Multi-Modal Primitive Retrieval for Compositional Zero-Shot Learning
DOI:10.1007/s11263-026-02763-w.png)
摘要
En 中文
组合泛化,即理解由已知基本元素组成的未见组合,是人类智能的基本属性之一。为了评估视觉模型的此类能力,组合零样本学习(CZSL)要求通过学习已知组合来识别未见属性-对象组合。对于CZSL而言,将学习到的已知基本元素(即属性或对象)的知识组合成新颖组合至关重要。在本工作中,我们提出了一种检索增强方法,用于显式地从视觉域和语言域检索已知基本元素的知识,以进行组合零样本学习。我们的方法通过检索模块增强了标准的多路径分类方法。具体而言,我们首先构建多个数据库,存储丰富多样的基本元素知识,包括训练图像的属性和对象表示,以及属性和对象的描述文本表示。对于输入的训练/测试图像,我们使用视觉和文本检索模块,分别检索具有相同属性和对象的训练图像表示和文本描述。通过使用检索到的表示来增强基本元素表示和输入图像的图像表示,以进行组合识别。通过参考语义相似图像和文本,所提出的方法能够为组合泛化回忆已知基本元素的知识。在三个广泛使用的数据集上的实验表明了所提出方法的有效性。
Keyword:
Multi-Modality
Retrieval Augmentation
Compositional Zero-Shot Learning
Compositional Generalization
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W
机构
引用论文
Revealing the Proximate Long-Tail Distribution in Compositional Zero-Shot Learning揭示组合式零样本学习中的近期长尾分布

