arrow
返回

Multi-resolution QP-adaptive generative face video compression using multi-level generator

delete2025-09-10
delete0
PRE
AI
W
Wenbo Kang
L
Lu Liu
C
Cheolkon Jung *
DOI:10.1016/j.neucom.2025.131484delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
本文提出了一种多分辨率量化参数(QP)自适应生成式人脸视频压缩(GFVC)框架,以实现超低码率下的人脸视频通信。通过利用深度生成模型和语义特征表示,所提出的框架在显著降低码率的同时实现了高感知质量。该框架根据QP值动态调整特征粒度,并集成多级多DConv头转置注意力(MDTA)和多级空间自适应反归一化(SPADE)等模块,以增强空间保真度和时间一致性。为保障适应性和标准化,我们进一步扩展了所提出的框架以支持多分辨率输入,并在VVC中引入基于补充增强信息(SEI)的特征编码。具体而言,我们引入标志gfv_enhancement_matrix_flag来传输可选增强矩阵,从而在符合VVC规范的前提下精确优化帧间重建。此外,还实现了多参考帧缓冲机制,通过注意力引导的参考选择提升长期时间连贯性。实验结果表明,与VVC基准(VTM-22.2 LDB模式)相比,所提出的GFVC框架在基准数据集上实现了DISTS指标平均BD-rate增益63.87%、LPIPS指标平均BD-rate增益61.99%。无需重新训练,该框架即可在分辨率为人脸视频上平稳运行,实现DISTS指标23.40%的BD-rate增益,并展现出强大的可扩展性。这些结果验证了所提出的GFVC框架在实际视频会议和远程呈现场景中的可行性,尤其是在超低带宽条件下。

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

暂无机构信息
引用论文

引用论文

Overview of the Versatile Video Coding (VVC) Standard and its Applications
err2021-10-01
err0
errOAAI
errBenjamin Bross; Ye-Kui Wang; Yan Ye; Shan Liu; Jianle Chen; Gary J. Sullivan; Jens-Rainer Ohm
err分享
err收藏
Road Segmentation for Remote Sensing Images Using Adversarial Spatial Pyramid Networks
err2021-06-01
err107
errOAAI
errShamsolmoali, Pourya; Zareapoor, Masoumeh; Zhou, Huiyu; Wang, Ruili; Yang, Jie
err分享
err收藏
Generator pyramid for high-resolution image inpainting
err2023-05-03
err7
errOAAI
errCao, Leilei; Yang, Tong; Wang, Yixu; Yan, Bo; Guo, Yandong
err分享
err收藏
没有更多内容