返回
Text augmentation for vision: Modality-preference aware few-shot learning
DOI:10.1016/j.knosys.2025.115122.png)
摘要
En 中文
近期在视觉-语言模型(如CLIP)方面的进展显示出在少样本学习方面的巨大潜力,但由于监督信息有限以及强制跨异构模态的统一优化目标存在次优性,其性能在极端低样本场景下会下降。为解决这一问题,我们提出了一种基于文本增强的模态偏好感知框架,以提升以视觉为中心的少样本图像分类效果。通过将文本描述作为辅助训练样本,我们的方法能够实现无需生成合成图像的有效且可扩展的数据增强。我们引入了一种名为交替模态监督(AMS)的训练策略,其中视觉和文本样本交替监督共享分类器以缓解梯度冲突。关键在于,我们识别出一种基于不同特征几何形状的模态偏好现象:高维视觉特征倾向于使用交叉熵(CE)进行判别,而语义文本特征则偏好使用均方误差(MSE)进行流形对齐。基于此,我们提出了模态偏好损失分配(MPLA),将每种模态与其偏好的目标对齐,从而提高优化稳定性。在多样化数据集和骨干网络架构上的大量实验证实,结合MPLA与AMS能够提升少样本性能,并展现出强大的泛化能力。
期刊
K
IF:
7.6
论文数:
1.3W
被引数:
4.5W
机构
引用论文
Task context transformer and GCN for few-shot learning of cross-domain任务上下文转换器和GCN用于跨域的少镜头学习
NEUROCOMPUTING
IF6.5

