arrow
返回

Optimizing automatic speech recognition with advanced transformers and metaheuristics

delete2026-01-14
delete0
PRE
AI
S
Sachi Gupta
G
Gaurav Agarwal *
S
Shivani Agarwal
A
Atul Kumar Rai
DOI:10.1016/j.bspc.2026.109464delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
自动语音识别(ASR)技术通过将口语转换为文本,实现了人与计算机之间的通信。然而,传统的ASR模型即使在应用了深度学习(DL)和机器学习(ML)技术后,仍然易受噪声干扰、失去语境理解能力,并且在超参数调优方面效率低下。为解决这些问题,本文提出了一种复杂的残差金字塔通道与空间注意力双向GRU Transformer(RPCSA-Bi-GRU)模型。研究首先采用改进的最小均方(MLMS)滤波技术消除噪声干扰。此外,该方法通过实现双向时序建模、多尺度特征提取和自注意力运算来提高识别精度。所提方法利用残差金字塔通道(RPC)模块提取多尺度语音特征,从而增强抗噪性。通过采用空间注意力双向GRU,进一步捕捉长距离依赖关系、增强语境表征并减少转录错误。本研究引入了一种增强的Coati元启发式优化(ECMO)方法,该方法能够高效动态地调整超参数以实现最佳性能,使收敛速度更快且分类精度高于传统调优方法。实验结果表明,所提ASR系统在Librispeech、SPGISpeech和GigaSpeech数据集上的准确率分别达到97.12%、97.11%和97.88%,从而在性能上超越了现有最优方法。研究结果证明,本研究开发了一种抗噪声模型,该模型在现实世界的ASR应用中既具有鲁棒性又计算可靠。

期刊

Biomedical Signal Processing and Control 封面图
Biomedical Signal Processing and Control
IF:
4.9
论文数:
1.0W
被引数:
2.4W

机构

G
Galgotias College of Engineering and Technology
学者数:
25
论文数: 20
被引数: 4
G
Galgotias University
学者数:
714
论文数: 643
被引数: 716
A
ajay kumar garg engineering college
学者数:
25
论文数: 19
被引数: 0
学者 查看更多机构
引用论文

引用论文

err分享
err收藏
Robust Automatic Speech Recognition Using Wavelet-Based Adaptive Wavelet Thresholding: A Review
err2024-02-01
err0
PREAI
errMahadevaswamy Shanthamallappa; Kiran Puttegowda; Naveen Kumar Hullahalli Nannappa; Sudheesh Kannur Vasudeva Rao
err分享
err收藏
Evaluation of the effectiveness and efficiency of state-of-the-art features and models for automatic speech recognition error detection
err2021-01-06
err6
errOAAI
errEl Hannani, Asmaa; Errattahi, Rahhal; Salmam, Fatima Zahra; Hain, Thomas; Ouahmane, Hassan
err分享
err收藏
err分享
err收藏
学者 查看更多内容