arrow
返回

BCTR: Bidirectional Conditioning Transformer for Scene Graph Generation

delete2025-06-07
delete0
delete
OA
AI
H
Hao Peng
W
Weilong Wang
王
王小兵 (Xiaobing Wang)
姜影影 封面图
姜影影 (Yingying Jiang)
H
Hanchao Jia
S
Shaowei Cui
J
Junhang Wei
X
Xiaoshuai Hao *
DOI:10.1016/j.inffus.2025.103260delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
场景图生成(SGG)由于其组合性质而仍然是一个具有挑战性的任务。先前的方法通过端到端学习提高了预测效率。然而,这些方法表现出有限的性能,因为它们假设实体和谓词之间存在单向条件关系,这限制了有效的信息交互。为解决这一局限性,我们提出了一种新颖的双向条件分解方法,用于语义对齐空间中的SGG,实现了实体和谓词之间高效且可泛化的交互。具体而言,我们引入了一个端到端场景图生成模型——双向条件Transformer(BCTR),以实现这种分解。BCTR包含两个关键模块。首先,双向条件生成器(BCG)在实体和谓词之间执行多阶段交互特征增强,实现了这些预测之间的相互增强。其次,随机特征对齐(RFA)用于通过从预训练模型中蒸馏多模态知识来正则化特征空间。在这个正则化的特征空间中,BCG可以在训练期间捕捉不同关系之间的交互模式,并且学习到的交互模式可以在推理期间泛化到未见但语义相关的关系。在Visual Genome和Open Image V6上的广泛实验表明,BCTR在两个基准上都达到了当前最优性能。
Keyword:
Scene graph generation
Scene understanding
Feature distillation

期刊

Information Fusion 封面图
Information Fusion
IF:
15.5
论文数:
4.2K
被引数:
2.7W

机构

S
Southwestern University of Finance and Economics
学者数:
938
论文数: 584
被引数: 56
S
samsung r&d inst china beijing
学者数:
12
论文数: 3
被引数: 3
B
beijing acad artificial intelligence
学者数:
9
论文数: 6
被引数: 3
C
chinese acad sci
学者数:
1.8W
论文数: 1.1W
被引数: 4.6K
学者 查看更多机构
引用论文

引用论文

err分享
err收藏
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations视觉基因组: 使用众包密集图像注释连接语言和视觉
err2017-02-06
err3.1K
errOAAI
errKrishna, Ranjay; Zhu, Yuke; Groth, Oliver; Johnson, Justin; Hata, Kenji; Kravitz, Joshua; Chen, Stephanie; Kalantidis, Yannis; Li, Li-Jia; Shamma, David A.; Bernstein, Michael S.; Li Fei-Fei
err分享
err收藏
err分享
err收藏
err分享
err收藏
Graphical Contrastive Losses for Scene Graph Parsing
err2019-06-01
err0
errOAAI
errJi Zhang; Kevin J. Shih; Ahmed Elgammal; Andrew Tao; Bryan Catanzaro
err分享
err收藏
学者 查看更多内容