返回
Optimizing automatic speech recognition with advanced transformers and metaheuristics
DOI:10.1016/j.bspc.2026.109464.png)
摘要
En 中文
自动语音识别(ASR)技术通过将口语转换为文本,实现了人与计算机之间的通信。然而,传统的ASR模型即使在应用了深度学习(DL)和机器学习(ML)技术后,仍然易受噪声干扰、失去语境理解能力,并且在超参数调优方面效率低下。为解决这些问题,本文提出了一种复杂的残差金字塔通道与空间注意力双向GRU Transformer(RPCSA-Bi-GRU)模型。研究首先采用改进的最小均方(MLMS)滤波技术消除噪声干扰。此外,该方法通过实现双向时序建模、多尺度特征提取和自注意力运算来提高识别精度。所提方法利用残差金字塔通道(RPC)模块提取多尺度语音特征,从而增强抗噪性。通过采用空间注意力双向GRU,进一步捕捉长距离依赖关系、增强语境表征并减少转录错误。本研究引入了一种增强的Coati元启发式优化(ECMO)方法,该方法能够高效动态地调整超参数以实现最佳性能,使收敛速度更快且分类精度高于传统调优方法。实验结果表明,所提ASR系统在Librispeech、SPGISpeech和GigaSpeech数据集上的准确率分别达到97.12%、97.11%和97.88%,从而在性能上超越了现有最优方法。研究结果证明,本研究开发了一种抗噪声模型,该模型在现实世界的ASR应用中既具有鲁棒性又计算可靠。
期刊
IF:
4.9
论文数:
1.0W
被引数:
2.4W
机构
引用论文
Evaluation of the effectiveness and efficiency of state-of-the-art features and models for automatic speech recognition error detection
JOURNAL OF BIG DATA
IF6.4
End-to-end neural automatic speech recognition system for low resource languages面向低资源语言的端到端神经自动语音识别系统
End-to-end automated speech recognition using a character based small scale transformer architecture

