返回
BCTR: Bidirectional Conditioning Transformer for Scene Graph Generation
DOI:10.1016/j.inffus.2025.103260.png)
摘要
En 中文
场景图生成(SGG)由于其组合性质而仍然是一个具有挑战性的任务。先前的方法通过端到端学习提高了预测效率。然而,这些方法表现出有限的性能,因为它们假设实体和谓词之间存在单向条件关系,这限制了有效的信息交互。为解决这一局限性,我们提出了一种新颖的双向条件分解方法,用于语义对齐空间中的SGG,实现了实体和谓词之间高效且可泛化的交互。具体而言,我们引入了一个端到端场景图生成模型——双向条件Transformer(BCTR),以实现这种分解。BCTR包含两个关键模块。首先,双向条件生成器(BCG)在实体和谓词之间执行多阶段交互特征增强,实现了这些预测之间的相互增强。其次,随机特征对齐(RFA)用于通过从预训练模型中蒸馏多模态知识来正则化特征空间。在这个正则化的特征空间中,BCG可以在训练期间捕捉不同关系之间的交互模式,并且学习到的交互模式可以在推理期间泛化到未见但语义相关的关系。在Visual Genome和Open Image V6上的广泛实验表明,BCTR在两个基准上都达到了当前最优性能。
Keyword:
Scene graph generation
Scene understanding
Feature distillation
期刊
IF:
15.5
论文数:
4.2K
被引数:
2.7W
机构
引用论文
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations视觉基因组: 使用众包密集图像注释连接语言和视觉

