返回
Static-dynamic class-level perception consistency in video semantic segmentation
DOI:10.1016/j.neunet.2025.107953.png)
摘要
En 中文
视频语义分割(VSS)已被广泛应用于许多领域,如同步定位与建图、自动驾驶和监控。其核心挑战是如何利用时序信息实现更好的分割。以往的研究主要关注像素级的静态-动态上下文匹配,利用光流和注意力机制等技术。与此不同,本文从类别层面重新思考静态-动态上下文,并提出了一种新颖的静态-动态类别级感知一致性(SD-CPC)框架。在该框架中,我们提出了基于对比学习的多变量类别原型和静态-动态语义对齐模块。前者为模型提供类别级约束,获取个性化的类别间特征和多样化的类别内特征。后者首先建立帧内空间的多尺度、多层级相关性,以实现静态语义对齐。然后,基于跨帧静态感知差异,执行两阶段跨帧选择性聚合,以实现动态语义对齐。同时,我们提出了一种基于窗口的注意力图计算方法,利用跨帧注意力点的稀疏性和Hadamard积,降低了跨帧注意力聚合的计算成本。值得注意的是,所提出的方法在VSPW数据集上使用MiT-B5达到了51.1 mIoU,在Cityscapes和CamVid数据集上分别使用ResNet101达到了81.6 mIoU和78.2 mIoU。这些结果超过了其他现有最先进方法的表现。我们的实现代码将在GitHub上开源。
Keyword:
video semantic segmentation
static-dynamic context
class-level perceptual consistency
contrastive learning
semantic alignment

