arrow
返回

DiffCTE: Consistent Visual Text Editing with High Style Fidelity via Diffusion Model

delete2026-01-01
delete0
PRE
AI
H
Haoyu Cao
A
Anqi Gou
H
Haobin Cao *
DOI:10.1007/978-981-95-5567-3_34delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
文本图像编辑是计算机视觉和图形学研究中的一个关键任务,具有广告设计、社交媒体内容创建等多样化应用。使用扩散模型(DFMs)生成具有可读性和一致性的高质量文本图像面临挑战,因为它们在处理文本样式和字形方面存在不足。本文提出DiffCTE(通过扩散模型实现高样式保真度的视觉文本编辑一致性),一种新颖的方法,通过为DFMs提供改进的样式条件指导来增强可读且样式一致的文本图像生成。利用由视觉编码器、样式抽象器和文本解码器组成的视觉语言模型(VLM),样式抽象器有效提取样式条件并跨语言表示样式信息,涵盖字形、字体和颜色等方面。通过将样式条件整合到DFMs中,DiffCTE能够生成视觉连贯且样式一致的文本。具体而言,生成的文本通过保持与参考样式的一致性实现样式迁移。我们的全面实验表明,DiffCTE相较于现有方法具有更优越的性能,为未来使用DFMs进行文本图像编辑的研究设定了新的方向。
Keyword:
Text editing
Style consistency
Diffusion model

期刊

P
PATTERN RECOGNITION AND COMPUTER VISION, PRCV 2025, PT V
IF:
0
论文数:
27
被引数:
0

机构

C
chinese academy of sciences
学者数:
56.7W
论文数: 44.9W
被引数: 704