arrow
返回

Text augmentation for vision: Modality-preference aware few-shot learning

delete2025-12-31
delete0
PRE
AI
Z
Zehua Hao
刘
刘芳 (Fang Liu)
S
Shuo Li
Y
Yaoyang Du
J
Jiahao Wang
H
Hao Wang
X
Xinyan Huang
L
Licheng Jiao
DOI:10.1016/j.knosys.2025.115122delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
近期在视觉-语言模型(如CLIP)方面的进展显示出在少样本学习方面的巨大潜力,但由于监督信息有限以及强制跨异构模态的统一优化目标存在次优性,其性能在极端低样本场景下会下降。为解决这一问题,我们提出了一种基于文本增强的模态偏好感知框架,以提升以视觉为中心的少样本图像分类效果。通过将文本描述作为辅助训练样本,我们的方法能够实现无需生成合成图像的有效且可扩展的数据增强。我们引入了一种名为交替模态监督(AMS)的训练策略,其中视觉和文本样本交替监督共享分类器以缓解梯度冲突。关键在于,我们识别出一种基于不同特征几何形状的模态偏好现象:高维视觉特征倾向于使用交叉熵(CE)进行判别,而语义文本特征则偏好使用均方误差(MSE)进行流形对齐。基于此,我们提出了模态偏好损失分配(MPLA),将每种模态与其偏好的目标对齐,从而提高优化稳定性。在多样化数据集和骨干网络架构上的大量实验证实,结合MPLA与AMS能够提升少样本性能,并展现出强大的泛化能力。

期刊

K
Knowledge-Based Systems
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

引用论文

引用论文

Brain-Inspired Learning, Perception, and Cognition: A Comprehensive Review脑启发学习、感知和认知: 综合评述
err2024-01-01
err0
PREAI
errJiao, Licheng; Ma, Mengru; He, Pei; Geng, Xueli; Liu, Xu; Liu, Fang; Ma, Wenping; Yang, Shuyuan; Hou, Biao; Tang, Xu
err分享
err收藏
Task context transformer and GCN for few-shot learning of cross-domain任务上下文转换器和GCN用于跨域的少镜头学习
err2023-09-01
err5
PREAI
errLi, Pengfang; Liu, Fang; Jiao, Licheng; Li, Lingling; Chen, Puhua; Li, Shuo
err分享
err收藏
LLM Knowledge-Driven Target Prototype Learning for Few-Shot Segmentation基于LLM知识驱动的小样本分割目标原型学习
err2025-03-01
err0
PREAI
errLi, Pengfang; Liu, Fang; Jiao, Licheng; Li, Shuo; Liu, Xu; Chen, Puhua; Li, Lingling; Hao, Zehua
err分享
err收藏
Logits DeConfusion with CLIP for Few-Shot Learning
err2025-06-10
err0
PREAI
errLi,Shuo; Liu,Fang; Hao,Zehua; Wang,Xinyi; Li,Lingling; Liu,Xu; Chen,Puhua; Ma,Wenping
err分享
err收藏
SGE: Semantic-guided Generalization Enhancement for Few-Shot Learning
err2025-07-01
err0
PREAI
errZheng,Zijun; Zhu,Yangyang; Wu,Heng; Lv,Laishui; Niu,Shanzhou; Yu,Gaohang
err分享
err收藏
Remote Sensing Video Tracking: Current Status, Challenges, and Future
err2025-01-01
err0
PREAI
errLiu,Fang; Wang,Jiahao; Jiao,Licheng; Zhang,Jie; Wang,Hao; Li,Shuo; Li,Lingling; Chen,Puhua; Liu,Xu; Ma,Wenping; Wang,Shuang; Yang,Shuyuan; Zhang,Xiangrong; Du,Yaoyang; Bao,Qianyue; Sun,Long; Hou,Biao
err分享
err收藏
Multiscale Deep Learning for Detection and Recognition: A Comprehensive Survey
err2024-01-01
err0
PREAI
errJiao, Licheng; Wang, Mengjiao; Liu, Xu; Li, Lingling; Liu, Fang; Feng, Zhixi; Yang, Shuyuan; Hou, Biao
err分享
err收藏
CLIP-Adapter: Better Vision-Language Models with Feature AdaptersCLIP-Adapter: 具有功能适配器的更好的视觉语言模型
err2023-09-15
err98
PREAI
errGao, Peng; Geng, Shijie; Zhang, Renrui; Ma, Teli; Fang, Rongyao; Zhang, Yongfeng; Li, Hongsheng; Qiao, Yu
err分享
err收藏
Augmentative contrastive learning for one-shot object detection
err2022-11-01
err12
PREAI
errDu, Yaoyang; Liu, Fang; Jiao, Licheng; Hao, Zehua; Li, Shuo; Liu, Xu; Liu, Jing
err分享
err收藏
学者 查看更多内容