返回
Global and sequence-level information maximization for self-supervised scene text recognition
DOI:10.1007/s10032-026-00577-7.png)
摘要
En 中文
场景文本识别(STR)是一种计算机视觉任务,用于预测图像中的文本。尽管理解完整字符序列需要大量标注的文本图像,但在实际场景中获取此类标注数据具有挑战性,因为标注成本高昂。因此,先前研究积极将STR与自监督学习相结合,例如对比学习或生成建模。然而,这些方法存在STR应用的局限性。例如,对比学习容易受到高频字符导致的假阴性影响,而生成建模可能捕获不必要的特征,如背景和噪声。此外,两种方法均无法考虑文本的序列特征。为克服这些限制,我们提出了一种基于信息最大化(STRIM)的STR自监督学习框架。STRIM通过在全局和局部层面减少冗余,有效学习文本和序列信息。值得注意的是,STRIM通过位置编码优化序列特征空间,从而捕捉文本的序列结构。实验结果表明,STRIM在基准数据集上实现了有竞争力的性能,并在标注数据极为有限时表现出卓越性能。
Keyword:
Information maximization
Redundancy reduction
Scene text recognition
Self-supervised learning
期刊
I
IF:
2.5
论文数:
40
被引数:
826
机构
引用论文
Enhancing robust VQA via contrastive and self-supervised learning通过对比和自监督学习增强鲁棒VQA
PATTERN RECOGNITION
IF7.6

