返回
Investigating Self-Supervised Methods for Label-Efficient Learning
DOI:10.1007/s11263-025-02397-4.png)
摘要
En 中文
视觉变压器与自监督学习相结合,已使模型能够在大型数据集上扩展至多个下游任务,包括分类、分割和检测。然而,这些模型在多个下游任务中的低样本学习潜力仍 largely 未被探索。在本工作中,我们系统地考察了不同的自监督预文本任务,即对比学习、聚类和掩码图像建模,通过比较不同的预训练模型来评估其低样本能力。此外,我们探讨了各种崩溃避免技术,如中心化、ME-MAX 和 Sinkhorn,对下游任务的影响。基于我们的详细分析,我们提出了一种框架,将掩码图像建模和聚类作为预文本任务。该框架在所有考察的低样本下游任务中表现出更优性能,包括多类分类、多标签分类和语义分割。此外,在大型数据集上测试模型时,我们展示了各种任务上的性能提升。
Keyword:
Vision transformers
Self-supervised learning
Low-shot learning
Masked image modelling
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W
机构
引用论文
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations视觉基因组: 使用众包密集图像注释连接语言和视觉

