arrow
返回

Temporal2Seq: A unified framework for temporal video understanding tasks

delete2026-04-17
delete0
PRE
AI
M
Min Yang
Z
Zichen Zhang
Q
Qian Dang
L
Limin Wang *
DOI:10.1016/j.cviu.2026.104770delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 我们提出了一种统一框架,用于处理时序视频理解任务。据我们所知,我们的Temporal2Seq是首个无需文本模态即可处理不同类型细粒度时序视频理解任务的统一视频建模框架。• 我们成功地在三个多样化的视频理解任务上联合训练了我们的Temporal2Seq模型,涵盖了检测、分割和时间戳定位。Temporal2Seq可通过简单的任务提示灵活应用于不同任务。• 我们的Temporal2Seq实证表明,在所有三个任务上,联合训练优于每个特定模型。我们的通用模型在公平条件下也取得了与现有任务特定模型相当的性能。我们还展示了其在这些任务的新数据集上的良好泛化能力。
Keyword:
Temporal video understanding
Unified framework
Co-training
Task prompt
Generalization ability

期刊

Computer Vision and Image Understanding 封面图
Computer Vision and Image Understanding
IF:
3.5
论文数:
450
被引数:
7.3K

机构

C
China Design Group Co., Ltd.
学者数:
2
论文数: 2
被引数: 0
N
nanjing university
学者数:
7.8W
论文数: 5.6W
被引数: 87
引用论文

引用论文

暂无论文信息