arrow
返回

Static-dynamic class-level perception consistency in video semantic segmentation

delete2025-08-07
delete0
delete
OA
AI
Z
Zhigang Cen
N
Ningyan Guo *
W
Wenjing Xu
Z
Zhiyong Feng
D
Danlan Huang
DOI:10.1016/j.neunet.2025.107953delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
视频语义分割(VSS)已被广泛应用于许多领域,如同步定位与建图、自动驾驶和监控。其核心挑战是如何利用时序信息实现更好的分割。以往的研究主要关注像素级的静态-动态上下文匹配,利用光流和注意力机制等技术。与此不同,本文从类别层面重新思考静态-动态上下文,并提出了一种新颖的静态-动态类别级感知一致性(SD-CPC)框架。在该框架中,我们提出了基于对比学习的多变量类别原型和静态-动态语义对齐模块。前者为模型提供类别级约束,获取个性化的类别间特征和多样化的类别内特征。后者首先建立帧内空间的多尺度、多层级相关性,以实现静态语义对齐。然后,基于跨帧静态感知差异,执行两阶段跨帧选择性聚合,以实现动态语义对齐。同时,我们提出了一种基于窗口的注意力图计算方法,利用跨帧注意力点的稀疏性和Hadamard积,降低了跨帧注意力聚合的计算成本。值得注意的是,所提出的方法在VSPW数据集上使用MiT-B5达到了51.1 mIoU,在Cityscapes和CamVid数据集上分别使用ResNet101达到了81.6 mIoU和78.2 mIoU。这些结果超过了其他现有最先进方法的表现。我们的实现代码将在GitHub上开源。
Keyword:
video semantic segmentation
static-dynamic context
class-level perceptual consistency
contrastive learning
semantic alignment

期刊

Neural Networks 封面图
Neural Networks
IF:
6.3
论文数:
8.2K
被引数:
3.0W

机构

暂无机构信息
引用论文

引用论文

暂无论文信息