返回
SAM-I2V++: Efficiently Upgrading SAM for Promptable Video Segmentation
DOI:10.1109/TPAMI.2025.3648863.png)
摘要
En 中文
基础模型如Segment Anything Model(SAM)显著推动了计算机视觉中可提示的图像分割技术。然而,将这些能力扩展到视频领域面临重大挑战,尤其是在动态场景中确保精确且时序一致的面具传播。SAM 2尝试通过从零开始在大量图像和视频数据上训练模型以学习复杂的时空关联来解决这个问题,但这导致了巨大的训练成本,阻碍了研究和实际部署。在本文中,我们介绍了SAM-I2V++,一种训练高效的视频升级方法,用于培养可提示的视频分割(PVS)模型。我们的方法战略性地升级预训练的SAM以支持PVS,显著降低了训练复杂性和资源需求。为此,我们引入了三项关键创新:(i)一个基于SAM静态图像编码器的图像到视频特征提取升级器,以实现时空视频感知;(ii)一个记忆选择关联器,通过相似性驱动的选择检索最相关的过去帧,并使用多尺度增强的交叉注意力将选择的记忆特征与当前帧关联;(iii)一种将记忆作为提示的机制,利用对象记忆确保动态场景中时序一致的面具传播。全面的实验表明,我们的方法在仅使用其训练成本的0.2%的情况下达到了SAM 2的93%性能。我们的工作为PVS提供了一条资源高效的途径,降低了PVS模型设计的进一步研究门槛,并促进了该领域更广泛的应用和进步。
Keyword:
Segment anything
promptable video segmentation
efficient training
temporal feature integration
memory selective association
memory prompt generation
期刊
IF:
18.6
论文数:
1.0K
被引数:
9.8W
机构
引用论文
RSPrompter: Learning to Prompt for Remote Sensing Instance Segmentation Based on Visual Foundation ModelRSPrompter: 基于视觉基础模型的遥感实例分割学习提示

