返回
Transformer-Based Reference Frame Synthesis for VVC Inter-Coding
DOI:10.1109/TCSVT.2026.3664925.png)
摘要
En 中文
已证明深度学习能生成高质量参考帧并在帧间编码中实现显著增益。现有的基于神经网络的参考帧生成(NN-RFG)方法主要基于感受野有限的卷积神经网络(CNN),并应用于Versatile Video Coding(VVC)。本文提出了一种基于Transformer的VVC帧间编码参考帧合成方法,命名为TRFS。我们将Transformer引入NN-RFG以捕获全局上下文信息,并构建多尺度特征金字塔以实现精确的光流估计。TRFS在VVC的解码图片缓冲区(DPB)和参考图片列表(RPL)之间运行,通过先前重建帧间的时空补偿生成新参考帧。首先,我们提出一种基于参数高效Transformer的层次化特征提取器,以捕获不同分辨率的全局上下文信息并构建多尺度特征金字塔。其次,我们设计了一种权重共享光流估计器,由残差块和Transformer组成,以粗到精的方式逐步细化双向或单向光流。第三,我们采用一种配备ConvNeXt变体的U-net帧增强器,以学习输入帧和变形帧的残差,同时消除后向变形引起的模糊失真。为训练TRFS网络,我们采用基于量化参数(QP)距离的两阶段增量学习策略,以解决压缩输入与其标签之间的QP差距不平衡问题,增强其学习能力。各种实验表明,TRFS相较于VTM-11.0_NNVC-10.0(NNVC工具禁用)在{Y, U, V}分量上实现了平均Bjøntegaard Delta码率(BD-rate)增益{RA: 6.61%, 13.86%, 13.30%}和{LB: 6.10%, 13.92%, 13.14%}。此外,与VTM-11.0_NNVC-10.0(NNVC工具启用)相比,TRFS在亮度分量上实现了平均BD-rate增益{RA: 4.43%和LB: 3.40%}。
Keyword:
Video coding
inter coding
inter prediction
reference frame generation
VVC
transformer
deep learning
期刊
IF:
11.1
论文数:
624
被引数:
3.1W
机构
引用论文
暂无论文信息

