arrow
返回

Inter-instance similarity modeling for contrastive learning

delete2026-07-01
delete0
PRE
AI
C
Chengchao Shen *
D
Dawei Liu
H
Hao Tang
Q
Qu, Zhe
王
王健鑫 (Jianxin Wang)
DOI:10.1016/j.patcog.2026.114509delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
现有对比学习方法广泛采用one-hot实例辨别作为自监督学习的预文本任务,这不可避免地忽略了自然图像中丰富的实例间相似性,从而导致潜在表示退化。本文提出了一种新颖的图像混合方法PatchMix,用于Vision Transformer(ViT)中的对比学习,以建模图像间的实例间相似性。遵循ViT的特性,我们在patch级别随机混合mini-batch中的多张图像,以构建混合图像patch序列供ViT使用。与现有的样本混合方法相比,我们的PatchMix能够灵活高效地混合超过两张图像,并模拟更复杂的自然图像间相似关系。通过这种方式,我们的对比框架可以显著缩小对比目标与现实ground truth之间的差距。实验结果表明,我们提出的方法在ImageNet-1K和CIFAR数据集上显著优于之前的最佳水平,例如,在ImageNet-1K上线性探测准确率提升3.0%,在CIFAR100上k-NN准确率提升8.7%。此外,我们的方法在下游任务(COCO数据集上的目标检测和实例分割)上取得了领先的迁移性能。代码和训练权重可在https://github.com/visresearch/patchmix获取。
Keyword:
Vision Transformer
Representation learning
Unsupervised Learning

期刊

Pattern Recognition 封面图
Pattern Recognition
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

C
Central South University
学者数:
4.5K
论文数: 1.2K
被引数: 0
引用论文

引用论文

暂无论文信息