返回
A Contrastive Learning-Based Multi-scale Attention Model for Text Recognition
DOI:10.1007/978-981-95-3483-8_20.png)
摘要
En 中文
光学字符识别(OCR)已在计算机视觉领域得到广泛应用,但复杂文本场景中的文本识别(TR)仍面临识别准确率低下的挑战。因此,提出了一种基于对比学习(CL)的多尺度注意力(CLMSA)模型用于文本识别,旨在提升模型在复杂文本场景中的识别能力。首先,通过引入多尺度注意力机制改进模态转换模块,以捕捉图像中的全局和局部特征,增强模型理解复杂文本内容的能力。其次,研究了基于数据增强的不变特征学习(DAIFL)策略,通过数据增强构建增强域,并基于多核最大均值差异(MK-MMD)优化模态转换模块,提升模型鲁棒性。第三,设计了基于字符相似度的对比损失(CSCL),通过计算不同图像间的字符相似度构建样本对,以改善模型在噪声场景中的识别效果。最后,进行了一系列实验验证所提模型的有效性。结果表明,所提出的CLMSA模型在复杂文本场景中能够获得优异的识别性能。
Keyword:
Contrastive Learning
Data Augmentation
Multi-Scale
Text Recognition
Transformer
期刊
B
IF:
0
论文数:
29
被引数:
0
机构
引用论文
CRNN-Based Abstract Artistic Text RecognitionTan, Z., Zhou, J., Liu, Y., 2023. 基于CRNN的抽象艺术文本识别,载于:2023年IEEE智能世界大会(SWC),IEEE。第652-659页。

