返回
ROLA: real-world object-centric learning with attention optimization
DOI:10.1007/s11432-024-4342-6.png)
摘要
En 中文
对象中心学习旨在将视觉场景解析为可组合且可解释的单位,称为“槽位”。该领域最近的进展,由Transformer等先进架构推动,显著提升了场景分解能力。然而,尽管取得这些进展,现有方法仍难以有效应对真实场景中固有的复杂性和多样性,常导致分解与重建结果次优。现有框架的关键局限在于其依赖DINO——要么作为冻结的编码器,要么作为编码特征的来源,为解码器提供重建目标——这限制了槽位到图像重建的效果,并妨碍了对不同对象数量场景的适应性。在此工作中,我们提出ROLA,一种新型方法,利用源自成熟DINO基对象中心学习或对象发现技术的对象性线索,来指导槽位注意力(Slot Attention)的优化。通过引入创新的注意力优化机制,ROLA在真实场景中实现了最先进的分解性能,持续超越DINO基基准。ROLA采用灵活的编码器-解码器架构,并整合了基于变分自编码器(VAE)的槽位解码器,该解码器能从槽位重建输入图像,同时促进解耦的对象中心表示。我们通过在CUB-200-2011(CUB鸟类)、COCO和PASCAL VOC等基准数据集上的严格实证评估,验证了该方法的有效性。我们的框架不仅提升了场景分解和槽位到图像重建的质量,还增强了学习表示的可解释性,推动了对象中心学习领域的最新进展。
Keyword:
object-centric learning
object discovery
slot attention
disentangled representation
computer vision
期刊
IF:
7.6
论文数:
4.9K
被引数:
8.9K
机构
引用论文
Grounding DINO: Marrying DINO with Grounded Pre-training for Open-Set Object Detection接地DINO: 将DINO与接地的预训练相结合,以进行开放式对象检测
没有更多内容

