arrow
返回

Joint Semantic and Coded Generation for Conditional Latent Coding

delete2026-06-10
delete0
PRE
AI
S
Siqi Wu
W
Weiming Chen
Y
Yinda Chen
刘东 (Dong Liu)
K
K. C. Ho
何志海 (Zhihai He)
DOI:10.1109/tcsvt.2026.3702531delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
深度图像压缩和文本到图像生成代表了视觉表示学习的两种不同范式:一种关注编码表示,而另一种强调语义表示。本文通过整合图像生成与压缩来弥合这两种范式之间的差距。我们提出了一种条件潜编码的联合语义与编码生成方法(JSCCL),该方法结合了最小编码特征和来自视觉-语言模型的语义描述,以指导可控的整流流模型。这种联合指导实现了高保真参考生成,同时捕捉语义一致性和结构细节。通过潜域的迭代对齐,我们合成了条件先验,用于高效的基于变换器的编码和解码。在Kodak、CLIC和Tecnick数据集上的实验结果表明,与VVC相比,该方法实现了最高15.8%的BD-rate改进,且仅增加0.01 bpp的开销。与现有仅从语义层面近似输入的生成式压缩方法不同,我们的方法实现了语义和像素级精确重建。
Keyword:
Image compression
generative models
rectified flow
conditional coding
semantic representation
deep learning

期刊

IEEE Transactions on Circuits and Systems for Video Technology 封面图
IEEE Transactions on Circuits and Systems for Video Technology
IF:
11.1
论文数:
624
被引数:
3.1W

机构

U
university of missouri
学者数:
1.3K
论文数: 603
被引数: 0
S
southern university of science and technology
学者数:
4.6K
论文数: 1.7K
被引数: 0
U
University of Science and Technology of China
学者数:
1.7W
论文数: 5.9K
被引数: 11.3W
学者 查看更多机构