返回
Semantically Corrected Amharic Automatic Speech Recognition
DOI:10.1007/978-3-032-05063-2_15.png)
摘要
En 中文
自动语音识别(ASR)在全球范围内提升口语语言的可及性方面发挥着关键作用。本文构建了一套适用于阿姆哈拉语(Amharic,主要在东非使用,使用者超过5000万)的ASR工具。阿姆哈拉语使用盖兹字母(Ge'ez script)书写,其字符序列中的空格表示单词边界。这使得阿姆哈拉语的计算处理具有挑战性,因为空格的位置会显著影响句子的含义。我们发现现有的阿姆哈拉语ASR基准测试未考虑这些空格,仅测量单个字符错误率,导致实际性能测量值被显著夸大。本文首先发布了现有阿姆哈拉语ASR测试数据集的修正转录,使社区能够准确评估进展。此外,我们引入了一种基于Transformer编码器-解码器架构的后处理方法,将原始ASR输出整理成语法完整且语义连贯的阿姆哈拉语句。通过在修正后的测试数据集上的实验,我们的模型提升了阿姆哈拉语语音识别系统的语义正确性,实现了5.5%的字符错误率(CER)和23.3%的单词错误率(WER)。
Keyword:
Speech Recognition
Sentence Correction
Semantically Corrected Sentence
Data Augmentation
期刊
P
机构
暂无机构信息

