返回
DiffCTE: Consistent Visual Text Editing with High Style Fidelity via Diffusion Model
DOI:10.1007/978-981-95-5567-3_34.png)
摘要
En 中文
文本图像编辑是计算机视觉和图形学研究中的一个关键任务,具有广告设计、社交媒体内容创建等多样化应用。使用扩散模型(DFMs)生成具有可读性和一致性的高质量文本图像面临挑战,因为它们在处理文本样式和字形方面存在不足。本文提出DiffCTE(通过扩散模型实现高样式保真度的视觉文本编辑一致性),一种新颖的方法,通过为DFMs提供改进的样式条件指导来增强可读且样式一致的文本图像生成。利用由视觉编码器、样式抽象器和文本解码器组成的视觉语言模型(VLM),样式抽象器有效提取样式条件并跨语言表示样式信息,涵盖字形、字体和颜色等方面。通过将样式条件整合到DFMs中,DiffCTE能够生成视觉连贯且样式一致的文本。具体而言,生成的文本通过保持与参考样式的一致性实现样式迁移。我们的全面实验表明,DiffCTE相较于现有方法具有更优越的性能,为未来使用DFMs进行文本图像编辑的研究设定了新的方向。
Keyword:
Text editing
Style consistency
Diffusion model
期刊
P
IF:
0
论文数:
27
被引数:
0

