返回
Informative Scene Graph Generation via Debiasing
DOI:10.1007/s11263-025-02365-y.png)
摘要
En 中文
场景图生成旨在检测视觉关系三元组(subject, predicate, object)。由于数据中的偏差,当前模型倾向于预测常见谓词(如on和at),而非信息丰富的谓词(如standing on和looking at)。这种倾向导致精确信息的丢失和整体性能下降。如果一个模型仅使用“stone on road”而非“stone blocking road”来描述图像,可能造成严重的误解。我们认为这种现象由两种不平衡引起:语义空间层不平衡和训练样本层不平衡。针对此问题,我们提出DB-SGG,一种基于消偏而非传统分布拟合的有效框架。它整合了两个组件:语义消偏(SD)和谓词平衡学习(BPL)以应对这些不平衡。SD利用混淆矩阵和二分图构建谓词关系。BPL采用随机欠采样策略和歧义消除策略,以聚焦于信息丰富的谓词。得益于模型无关的流程,我们的方法可轻松应用于SGG模型,并在SGG-VG数据集的三个SGG子任务上的mR@20指标上分别超越Transformer模型136.3%、119.5%和122.6%。我们的方法进一步在另一个复杂的SGG数据集(SGG-GQA)以及两个下游任务(句子到图的检索和图像描述生成)中得到验证。
Keyword:
Scene graph generation
Visual relationship
Debaising
Information content.
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W

