返回
2D Positional Embedding-based Transformer for Scene Text Recognition
DOI:10.15353/jcvis.v6i1.3533.png)
摘要
En 中文
近年来,先进的场景文本识别方法主要基于循环神经网络(RNNs),然而,这些方法需要一维(1D)特征,并且由于丢失了原始二维(2D)图像中的空间信息,它们并非为识别不规则文本实例而设计。在本文中,我们利用一种基于Transformer的架构来识别野外的规则和不规则文本图像。所提出的方法利用了在Transformer架构中使用二维位置编码器,以比以往方法更好地保留二维图像特征的空间信息。在包括具有挑战性的COCO-Text数据集在内的流行基准测试上的实验表明,所提出的场景文本识别方法在大多数情况下优于当前最佳水平,特别是在不规则文本识别方面。
期刊
暂无期刊信息
机构
暂无机构信息
引用论文
暂无论文信息

