arrow
返回

Printed OCR for Extremely Low-Resource Indic Languages

delete2026-01-01
delete0
PRE
AI
S
Sarkar, Alik *
A
Ajoy Mondal
G
Gurpreet Singh Lehal
C
C. V. Jawahar
DOI:10.1007/978-3-031-93691-3_9delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
印度语言代表了印度文化遗产的重要方面,体现了集体知识、传统和习俗。保护这一遗产至关重要。光学字符识别(OCR)技术通过从图像中提取文本,有助于简化文本识别任务。本研究使用现有的OCR模型对极低资源印度语言的文档图像进行数字化,而这些语言在以往的OCR工作中并未受到关注。为这些语言准备语料库具有挑战性,因为缺乏语言专家以及所需的时间和资源。我们引入了一个合成数据集Mozhi-LR(S)和一个真实数据集Mozhi-LR(R),包含这些九种语言的词级图像及其文本转录。我们使用合成数据集训练模型,并使用真实数据集进行微调,在合成和真实数据集上均实现了高精度。此外,我们提供了基于网络的APP,将我们的OCR模型与API集成。这种集成促进了极低资源印度语言印刷文档的数字化。本工作中使用的代码库、训练模型和数据集可通过https://github.com/ALIKSARKAR/Printed-ELRIL-OCR公开访问。
Keyword:
OCR
Indic language
Indic script
low-resource language
printed text

期刊

C
COMPUTER VISION AND IMAGE PROCESSING, CVIP 2024, PT II
IF:
0
论文数:
33
被引数:
0

机构

I
International Institute of Information Technology Hyderabad
学者数:
779
论文数: 685
被引数: 5
引用论文

引用论文

Multi-dimensional Recurrent Neural Networks
err2007-01-01
err0
PREAI
errAlex Graves; Santiago Fernández; Jürgen Schmidhuber
err分享
err收藏
A complete printed Bangla OCR system
err1998-03-01
err213
PREAI
errChaudhuri, BB; Pal, U
err分享
err收藏
Indian script character recognition: a survey
err2004-09-01
err261
PREAI
errPal, U; Chaudhuri, BB
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
学者 查看更多内容