arrow
返回

2D Positional Embedding-based Transformer for Scene Text Recognition

delete2021-01-15
delete0
delete
OA
AI
DOI:10.15353/jcvis.v6i1.3533delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
近年来,先进的场景文本识别方法主要基于循环神经网络(RNNs),然而,这些方法需要一维(1D)特征,并且由于丢失了原始二维(2D)图像中的空间信息,它们并非为识别不规则文本实例而设计。在本文中,我们利用一种基于Transformer的架构来识别野外的规则和不规则文本图像。所提出的方法利用了在Transformer架构中使用二维位置编码器,以比以往方法更好地保留二维图像特征的空间信息。在包括具有挑战性的COCO-Text数据集在内的流行基准测试上的实验表明,所提出的场景文本识别方法在大多数情况下优于当前最佳水平,特别是在不规则文本识别方面。

期刊

暂无期刊信息

机构

暂无机构信息
引用论文

引用论文

暂无论文信息