返回
Language-guided Recursive Spatiotemporal Graph Modeling for Video Summarization
DOI:10.1007/s11263-025-02577-2.png)
摘要
En 中文
视频摘要的目标是选择视觉上多样且能代表给定视频整体内容的帧。现有方法通过时序建模关注视频帧之间的全局关联性。然而,细粒度的视觉实体(如物体)也与视频的主要内容高度相关。此外,近期研究的语言引导视频摘要需要全面理解复杂现实视频的语言学知识。为考虑所有物体之间的语义关联,本文将视频摘要视为一个语言引导的时空图建模问题。我们提出了一种递归时空图网络,称为VideoGraph,它将物体和帧分别建模为空间图和时间图的节点。图中的节点通过图边连接和聚合,表示节点间的语义关系。为防止边仅由视觉相似性配置,我们将从视频中提取的语言查询融入图节点表示中,使节点包含语义知识。此外,我们采用递归策略优化初始图,并正确分类每个帧节点是否为关键帧。在实验中,VideoGraph在监督和无监督两种模式下,在通用和基于查询的视频摘要基准上均取得了当前最佳性能。代码可访问https://github.com/park-jungin/videograph 。
Keyword:
Language-guided video summarization
Recursive graph refinement
Spatiotemporal graph convolutional networks
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W
机构
引用论文
Spatial Temporal Graph Convolutional Networks for Skeleton-Based Action Recognition用于基于骨架的动作识别的时空图卷积网络
Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations视觉基因组: 使用众包密集图像注释连接语言和视觉

