arrow
返回

Transformer-Based Reference Frame Synthesis for VVC Inter-Coding

delete2026-02-16
delete0
PRE
AI
Q
Qipu Qin
C
Cheolkon Jung
DOI:10.1109/TCSVT.2026.3664925delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
已证明深度学习能生成高质量参考帧并在帧间编码中实现显著增益。现有的基于神经网络的参考帧生成(NN-RFG)方法主要基于感受野有限的卷积神经网络(CNN),并应用于Versatile Video Coding(VVC)。本文提出了一种基于Transformer的VVC帧间编码参考帧合成方法,命名为TRFS。我们将Transformer引入NN-RFG以捕获全局上下文信息,并构建多尺度特征金字塔以实现精确的光流估计。TRFS在VVC的解码图片缓冲区(DPB)和参考图片列表(RPL)之间运行,通过先前重建帧间的时空补偿生成新参考帧。首先,我们提出一种基于参数高效Transformer的层次化特征提取器,以捕获不同分辨率的全局上下文信息并构建多尺度特征金字塔。其次,我们设计了一种权重共享光流估计器,由残差块和Transformer组成,以粗到精的方式逐步细化双向或单向光流。第三,我们采用一种配备ConvNeXt变体的U-net帧增强器,以学习输入帧和变形帧的残差,同时消除后向变形引起的模糊失真。为训练TRFS网络,我们采用基于量化参数(QP)距离的两阶段增量学习策略,以解决压缩输入与其标签之间的QP差距不平衡问题,增强其学习能力。各种实验表明,TRFS相较于VTM-11.0_NNVC-10.0(NNVC工具禁用)在{Y, U, V}分量上实现了平均Bjøntegaard Delta码率(BD-rate)增益{RA: 6.61%, 13.86%, 13.30%}和{LB: 6.10%, 13.92%, 13.14%}。此外,与VTM-11.0_NNVC-10.0(NNVC工具启用)相比,TRFS在亮度分量上实现了平均BD-rate增益{RA: 4.43%和LB: 3.40%}。
Keyword:
Video coding
inter coding
inter prediction
reference frame generation
VVC
transformer
deep learning

期刊

IEEE Transactions on Circuits and Systems for Video Technology 封面图
IEEE Transactions on Circuits and Systems for Video Technology
IF:
11.1
论文数:
624
被引数:
3.1W

机构

X
xidian university
学者数:
6.5K
论文数: 2.2K
被引数: 0
引用论文

引用论文

暂无论文信息