返回
Printed OCR for Extremely Low-Resource Indic Languages
DOI:10.1007/978-3-031-93691-3_9.png)
摘要
En 中文
印度语言代表了印度文化遗产的重要方面,体现了集体知识、传统和习俗。保护这一遗产至关重要。光学字符识别(OCR)技术通过从图像中提取文本,有助于简化文本识别任务。本研究使用现有的OCR模型对极低资源印度语言的文档图像进行数字化,而这些语言在以往的OCR工作中并未受到关注。为这些语言准备语料库具有挑战性,因为缺乏语言专家以及所需的时间和资源。我们引入了一个合成数据集Mozhi-LR(S)和一个真实数据集Mozhi-LR(R),包含这些九种语言的词级图像及其文本转录。我们使用合成数据集训练模型,并使用真实数据集进行微调,在合成和真实数据集上均实现了高精度。此外,我们提供了基于网络的APP,将我们的OCR模型与API集成。这种集成促进了极低资源印度语言印刷文档的数字化。本工作中使用的代码库、训练模型和数据集可通过https://github.com/ALIKSARKAR/Printed-ELRIL-OCR公开访问。
Keyword:
OCR
Indic language
Indic script
low-resource language
printed text
期刊
C
IF:
0
论文数:
33
被引数:
0
机构
引用论文
A font and size-independent OCR system for printed Kannada documents using support vector machines
Sadhana
IF0

