arrow
返回

Global and sequence-level information maximization for self-supervised scene text recognition

delete2026-01-01
delete0
PRE
AI
K
Kim, Sungsu
K
Kim, Seoung Bum *
DOI:10.1007/s10032-026-00577-7delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
场景文本识别(STR)是一种计算机视觉任务,用于预测图像中的文本。尽管理解完整字符序列需要大量标注的文本图像,但在实际场景中获取此类标注数据具有挑战性,因为标注成本高昂。因此,先前研究积极将STR与自监督学习相结合,例如对比学习或生成建模。然而,这些方法存在STR应用的局限性。例如,对比学习容易受到高频字符导致的假阴性影响,而生成建模可能捕获不必要的特征,如背景和噪声。此外,两种方法均无法考虑文本的序列特征。为克服这些限制,我们提出了一种基于信息最大化(STRIM)的STR自监督学习框架。STRIM通过在全局和局部层面减少冗余,有效学习文本和序列信息。值得注意的是,STRIM通过位置编码优化序列特征空间,从而捕捉文本的序列结构。实验结果表明,STRIM在基准数据集上实现了有竞争力的性能,并在标注数据极为有限时表现出卓越性能。
Keyword:
Information maximization
Redundancy reduction
Scene text recognition
Self-supervised learning

期刊

I
International Journal on Document Analysis and Recognition
IF:
2.5
论文数:
40
被引数:
826

机构

K
korea university
学者数:
4.9K
论文数: 2.2K
被引数: 1
引用论文

引用论文

ICDAR 2015 competition on Robust ReadingICDAR 2015稳健阅读竞赛
err2015-08-01
err0
PREAI
errDimosthenis Karatzas; Lluis Gomez-Bigorda; Anguelos Nicolaou; Suman Ghosh; Andrew Bagdanov; Masakazu Iwamura; Jiri Matas; Lukas Neumann; Vijay Ramaseshan Chandrasekhar; Shijian Lu; Faisal Shafait; Seiichi Uchida; Ernest Valveny
err分享
err收藏
Enhancing robust VQA via contrastive and self-supervised learning通过对比和自监督学习增强鲁棒VQA
err2025-03-01
err1
PREAI
errCao, Runlin; Li, Zhixin; Tang, Zhenjun; Zhang, Canlong; Ma, Huifang
err分享
err收藏
ICDAR 2013 Robust Reading CompetitionICDAR 2013稳健阅读竞赛
err2013-08-01
err0
PREAI
errDimosthenis Karatzas; Faisal Shafait; Seiichi Uchida; Masakazu Iwamura; Lluis Gomez i Bigorda; Sergi Robles Mestre; Joan Mas; David Fernandez Mota; Jon Almazan Almazan; Lluis Pere de las Heras
err分享
err收藏
Inverse-Like Antagonistic Scene Text Spotting via Reading-Order Estimation and Dynamic Sampling
err2024-01-01
err2
errOAAI
errZhang, Shi-Xue; Yang, Chun; Zhu, Xiaobin; Zhou, Hongyang; Wang, Hongfa; Yin, Xu-Cheng
err分享
err收藏
ICDAR 2003 robust reading competitions: entries, results, and future directions
err2005-07-01
err0
PREAI
errSimon M. Lucas; Alex Panaretos; Luis Sosa; Anthony Tang; Shirley Wong; Robert Young; Kazuki Ashida; Hiroki Nagai; Masayuki Okamoto; Hiroaki Yamamoto; Hidetoshi Miyao; JunMin Zhu; WuWen Ou; Christian Wolf; Jean-Michel Jolion; Leon Todoran; Marcel Worring; Xiaofan Lin
err分享
err收藏
err分享
err收藏
CarveNet: a channel-wise attention-based network for irregular scene text recognition
err
IF0
err2022-04-05
err0
PREAI
errGuibin Wu; Zheng Zhang; Yongping Xiong
err分享
err收藏
学者 查看更多内容