返回
Fusing Text Semantics for Text Image Inpainting
DOI:10.1007/978-3-032-04630-7_22.png)
摘要
En 中文
在真实场景中,图像中的文本常因遮挡、噪声、褪色或物理损坏等因素而受到破坏。这些退化现象在街景文本识别和场景文本理解等多样应用中普遍存在,显著阻碍了文本在光学字符识别和自然语言处理等下游任务中的实用性。现有文本图像修复方法通常依赖额外提示或外部数据来指导修复过程,这不仅增加了复杂性,也限制了其在缺乏此类辅助信息场景下的适用性。为解决这些挑战,我们提出了一种新颖方法,即多模态文本修复网络(MMTINet),该方法直接从图像本身提取并融合文本语义,无需任何外部提示。通过利用图像内的固有文本信息,我们的方法实现了更无缝且上下文敏感的修复,显著提升了重建文本的准确性和保真度。我们在基准数据集上评估了MMTINet,展示了其在恢复缺失或遮挡文本的同时保留原始内容和风格的有效性。实验结果突显了该方法的有效性和潜力,展示了其通过图像驱动的文本语义提升文本修复任务的优越性能。
Keyword:
Text Image Inpainting
Multimodal Fusion
期刊
D
IF:
0
论文数:
28
被引数:
0

