arrow
返回

Autoregressive Temporal Modeling for Advanced Tracking-by-Diffusion

delete2025-05-09
delete0
PRE
AI
P
Pha Nguyen
R
Rishi Madhok
B
Bhiksha Raj
K
Khoa Luu *
DOI:10.1007/s11263-025-02439-xdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
目标跟踪是计算机视觉领域广泛研究的任务,具有视频和实例分析的应用。尽管跟踪回归、检测、注意力等范式推动了该领域的发展,但生成建模提供了新的潜力。虽然一些研究在实例基础理解任务中探索了生成过程,但它们依赖于坐标空间中的预测细化,而非视觉域。相反,本文提出了基于扩散的目标跟踪(Tracking-by-Diffusion),一种视频目标跟踪的新范式,通过自回归模型的角度利用视觉生成模型。该范式在点、框和掩码模态中表现出广泛适用性,并独特地支持文本引导。我们提出了DIFTracker框架,该框架利用迭代的潜在变量扩散模型,将跟踪重新定义为下一帧重建任务。我们的方法独特地结合了视频数据中的空间和时序依赖关系,提供了一种统一的解决方案,将现有跟踪范式包含在单一的逆向-重建过程中。DIFTracker在线运行且自回归,能够实现灵活的实例基础视频理解。它使我们能够克服视频膨胀模型在可变长度视频理解中遇到的困难,并在五个模态的七个基准上实现卓越性能。本文不仅为视觉自回归建模在理解顺序视觉数据(特别是视频)方面提供了新视角,还提供了稳健的理论验证,并展示了在视觉跟踪和计算机视觉中的更广泛应用。
Keyword:
Autoregressive models
Diffusion models
Visual tracking
Unification

期刊

International Journal of Computer Vision 封面图
International Journal of Computer Vision
IF:
9.3
论文数:
3.9K
被引数:
2.8W

机构

U
Univ Arkansas
学者数:
375
论文数: 210
被引数: 57
M
microsoft
学者数:
384
论文数: 185
被引数: 17
引用论文

引用论文

err分享
err收藏
err分享
err收藏
MOTR: End-to-End Multiple-Object Tracking with Transformer
err2022-10-30
err0
PREAI
errFangao Zeng; Bin Dong; Yuang Zhang; Tiancai Wang; Xiangyu Zhang; Yichen Wei
err分享
err收藏
学者 查看更多内容