返回
Aligning enhanced feature representation for generalized zero-shot learning
DOI:10.1007/s11432-023-4174-4.png)
摘要
En 中文
通过将跨模态变分自编码器(VAEs)的潜在空间对齐,构建有效的共享潜在嵌入,是广义零样本学习(GZSL)的一种流行策略。然而,由于缺乏精细化的实例级标注,现有的VAE方法容易受到后验塌陷问题的影响。本文提出了一种通过增强特征表示对齐(AEFR)的创新的非对称VAE网络,用于GZSL。与一般的VAE结构不同,我们设计了两个非对称编码器用于视觉和语义观测,以及一个用于视觉重建的解码器。具体而言,我们在视觉编码器中提出了一种简单而有效的门控注意力机制(GAM),用于增强观测与潜在变量之间的信息交互,有效缓解可能出现的后验塌陷问题。此外,我们提出了一种基于分布解耦的对比学习(D2-CL),用于在潜在表示空间中对齐分类学层级表示的同时,指导学习分类相关信息。在公开可用数据集上的广泛实验证明了我们方法的最优性能。源代码可从https://github.com/seeyourmind/AEFR获取。
Keyword:
generalized zero-shot learning
gated attention mechanism
contrastive learning
multi-modal alignment
期刊
IF:
7.6
论文数:
4.9K
被引数:
8.9K

