arrow
返回

SAM-I2V++: Efficiently Upgrading SAM for Promptable Video Segmentation

delete2025-12-26
delete0
PRE
AI
H
Haiyang Mei
P
Pengyu Zhang
M
Mike Zheng Shou
DOI:10.1109/TPAMI.2025.3648863delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
基础模型如Segment Anything Model(SAM)显著推动了计算机视觉中可提示的图像分割技术。然而,将这些能力扩展到视频领域面临重大挑战,尤其是在动态场景中确保精确且时序一致的面具传播。SAM 2尝试通过从零开始在大量图像和视频数据上训练模型以学习复杂的时空关联来解决这个问题,但这导致了巨大的训练成本,阻碍了研究和实际部署。在本文中,我们介绍了SAM-I2V++,一种训练高效的视频升级方法,用于培养可提示的视频分割(PVS)模型。我们的方法战略性地升级预训练的SAM以支持PVS,显著降低了训练复杂性和资源需求。为此,我们引入了三项关键创新:(i)一个基于SAM静态图像编码器的图像到视频特征提取升级器,以实现时空视频感知;(ii)一个记忆选择关联器,通过相似性驱动的选择检索最相关的过去帧,并使用多尺度增强的交叉注意力将选择的记忆特征与当前帧关联;(iii)一种将记忆作为提示的机制,利用对象记忆确保动态场景中时序一致的面具传播。全面的实验表明,我们的方法在仅使用其训练成本的0.2%的情况下达到了SAM 2的93%性能。我们的工作为PVS提供了一条资源高效的途径,降低了PVS模型设计的进一步研究门槛,并促进了该领域更广泛的应用和进步。
Keyword:
Segment anything
promptable video segmentation
efficient training
temporal feature integration
memory selective association
memory prompt generation

期刊

IEEE Transactions on Pattern Analysis and Machine Intelligence 封面图
IEEE Transactions on Pattern Analysis and Machine Intelligence
IF:
18.6
论文数:
1.0K
被引数:
9.8W

机构

N
national university of singapore
学者数:
4.6K
论文数: 2.4K
被引数: 1
引用论文

引用论文

Segment anything, from space?
err2024-01-03
err0
PREAI
errSimiao Ren; Francesco Luzi; Saad Lahrichi; Kaleb Kassaw; Leslie M. Collins; Kyle Bradbury; Jordan M. Malof
err分享
err收藏
Spike-BRGNet: Efficient and Accurate Event-Based Semantic Segmentation With Boundary Region-Guided Spiking Neural Networks
err2025-03-01
err0
PREAI
errLong,Xianlei; Zhu,Xiaxin; Guo,Fangming; Chen,Chao; Zhu,Xiangwei; Gu,Fuqiang; Yuan,Songyu; Zhang,Chunlong
err分享
err收藏
Efficient Video Object Segmentation via Network Modulation
err2018-06-01
err0
errOAAI
errLinjie Yang; Yanran Wang; Xuehan Xiong; Jianchao Yang; Aggelos K. Katsaggelos
err分享
err收藏
Tracking Anything with Decoupled Video Segmentation
err2023-10-01
err0
errOAAI
errHo Kei Cheng; Seoung Wug Oh; Brian Price; Alexander Schwing; Joon-Young Lee
err分享
err收藏
学者 查看更多内容