返回
Multi-Domain Spatial-Temporal Redundancy Mining for Efficient Learned Video Compression
DOI:10.1109/TBC.2025.3587532.png)
摘要
En 中文
基于条件编码的 Learned Video Compression (CC-LVC) 已成为 Learned Video Compression 领域的重要范式,因为它能够有效探索巨大上下文空间中的时空冗余。然而,现有的 CC-LVC 方法无法准确建模运动信息,也难以高效挖掘非刚性运动和非线性形变复杂区域的上下文相关性。为解决这些问题,本文提出了一种高效的 CC-LVC 方法,该方法通过挖掘多运动域和感受域间的时空依赖关系来提升视频编码效率。为准确建模复杂运动并生成精确的时域上下文,本文提出了一种 Multi-domain Motion modeling Network (MMNet),用于从空间域和频率域捕获鲁棒的运动信息。此外,开发了一种多域上下文精炼模块,用于有选择地突出频率域时域上下文并自适应融合多域时域上下文,从而有效缓解运动误差导致的时域上下文不准确问题。为高效压缩视频信号,本文提出了一种基于 Multi-scale Long Short-range Decorrelation Module (MLSDM) 的上下文编解码器,其中设计的 MLSDM 用于学习不同感受域间的长短期时空依赖关系及通道级相关性。大量实验结果表明,所提出的方法在 PSNR 和 MS-SSIM 指标上显著优于 VTM 17.0 及其他当前最先进的 Learned Video Compression 方法。
Keyword:
Learned video compression
conditional coding
frequency decomposition
multi-scale long short-range decorrelation
visual state space block
期刊
IF:
4.8
论文数:
2.1K
被引数:
3.0K
机构
引用论文
Spatial Decomposition and Temporal Fusion Based Inter Prediction for Learned Video Compression基于空间分解与时间融合的帧间预测方法用于学习型视频压缩

