返回
Multi-resolution QP-adaptive generative face video compression using multi-level generator
DOI:10.1016/j.neucom.2025.131484.png)
摘要
En 中文
本文提出了一种多分辨率量化参数(QP)自适应生成式人脸视频压缩(GFVC)框架,以实现超低码率下的人脸视频通信。通过利用深度生成模型和语义特征表示,所提出的框架在显著降低码率的同时实现了高感知质量。该框架根据QP值动态调整特征粒度,并集成多级多DConv头转置注意力(MDTA)和多级空间自适应反归一化(SPADE)等模块,以增强空间保真度和时间一致性。为保障适应性和标准化,我们进一步扩展了所提出的框架以支持多分辨率输入,并在VVC中引入基于补充增强信息(SEI)的特征编码。具体而言,我们引入标志gfv_enhancement_matrix_flag来传输可选增强矩阵,从而在符合VVC规范的前提下精确优化帧间重建。此外,还实现了多参考帧缓冲机制,通过注意力引导的参考选择提升长期时间连贯性。实验结果表明,与VVC基准(VTM-22.2 LDB模式)相比,所提出的GFVC框架在基准数据集上实现了DISTS指标平均BD-rate增益63.87%、LPIPS指标平均BD-rate增益61.99%。无需重新训练,该框架即可在分辨率为人脸视频上平稳运行,实现DISTS指标23.40%的BD-rate增益,并展现出强大的可扩展性。这些结果验证了所提出的GFVC框架在实际视频会议和远程呈现场景中的可行性,尤其是在超低带宽条件下。
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
暂无机构信息
引用论文
WCDGAN: Weakly Connected Dense Generative Adversarial Network for Artifact Removal of Highly Compressed Images
IEEE ACCESS
IF3.6
没有更多内容

