返回
Temporal2Seq: A unified framework for temporal video understanding tasks
DOI:10.1016/j.cviu.2026.104770.png)
摘要
En 中文
• 我们提出了一种统一框架,用于处理时序视频理解任务。据我们所知,我们的Temporal2Seq是首个无需文本模态即可处理不同类型细粒度时序视频理解任务的统一视频建模框架。• 我们成功地在三个多样化的视频理解任务上联合训练了我们的Temporal2Seq模型,涵盖了检测、分割和时间戳定位。Temporal2Seq可通过简单的任务提示灵活应用于不同任务。• 我们的Temporal2Seq实证表明,在所有三个任务上,联合训练优于每个特定模型。我们的通用模型在公平条件下也取得了与现有任务特定模型相当的性能。我们还展示了其在这些任务的新数据集上的良好泛化能力。
Keyword:
Temporal video understanding
Unified framework
Co-training
Task prompt
Generalization ability
期刊
IF:
3.5
论文数:
450
被引数:
7.3K
机构
引用论文
暂无论文信息

