返回
Inter-instance similarity modeling for contrastive learning
DOI:10.1016/j.patcog.2026.114509.png)
摘要
En 中文
现有对比学习方法广泛采用one-hot实例辨别作为自监督学习的预文本任务,这不可避免地忽略了自然图像中丰富的实例间相似性,从而导致潜在表示退化。本文提出了一种新颖的图像混合方法PatchMix,用于Vision Transformer(ViT)中的对比学习,以建模图像间的实例间相似性。遵循ViT的特性,我们在patch级别随机混合mini-batch中的多张图像,以构建混合图像patch序列供ViT使用。与现有的样本混合方法相比,我们的PatchMix能够灵活高效地混合超过两张图像,并模拟更复杂的自然图像间相似关系。通过这种方式,我们的对比框架可以显著缩小对比目标与现实ground truth之间的差距。实验结果表明,我们提出的方法在ImageNet-1K和CIFAR数据集上显著优于之前的最佳水平,例如,在ImageNet-1K上线性探测准确率提升3.0%,在CIFAR100上k-NN准确率提升8.7%。此外,我们的方法在下游任务(COCO数据集上的目标检测和实例分割)上取得了领先的迁移性能。代码和训练权重可在https://github.com/visresearch/patchmix获取。
Keyword:
Vision Transformer
Representation learning
Unsupervised Learning

