返回
Joint Semantic and Coded Generation for Conditional Latent Coding
DOI:10.1109/tcsvt.2026.3702531.png)
摘要
En 中文
深度图像压缩和文本到图像生成代表了视觉表示学习的两种不同范式:一种关注编码表示,而另一种强调语义表示。本文通过整合图像生成与压缩来弥合这两种范式之间的差距。我们提出了一种条件潜编码的联合语义与编码生成方法(JSCCL),该方法结合了最小编码特征和来自视觉-语言模型的语义描述,以指导可控的整流流模型。这种联合指导实现了高保真参考生成,同时捕捉语义一致性和结构细节。通过潜域的迭代对齐,我们合成了条件先验,用于高效的基于变换器的编码和解码。在Kodak、CLIC和Tecnick数据集上的实验结果表明,与VVC相比,该方法实现了最高15.8%的BD-rate改进,且仅增加0.01 bpp的开销。与现有仅从语义层面近似输入的生成式压缩方法不同,我们的方法实现了语义和像素级精确重建。
Keyword:
Image compression
generative models
rectified flow
conditional coding
semantic representation
deep learning

