返回
Spectrogram Features-Based Automatic Speaker Identification For Smart Services
DOI:10.1080/08839514.2025.2459476.png)
摘要
En 中文
自动语音识别(ASI)是一个引人入胜的研究领域,具有广泛的应用,如监控、语音认证、身份验证和电子语音窃听。本研究探讨了基于从频谱图图像中提取的特征,通过使用矩形卷积核的卷积神经网络(CNN)进行自动语音识别。传统上,CNN采用方形卷积核和各层的最大池化操作,这是一种针对2D数据优化的设计。然而,在处理频谱图时,信息编码方式略有不同。频率沿y轴显示,x轴表示音频的时间。振幅由频谱图图像中特定点的强度表示。本研究的主要贡献如下:1. 为了有效分析音频信号,本研究提出了使用不同大小和形状的矩形卷积核提取频谱特征,以提升语音识别系统的识别精度,从而获得更具区分性的特征。2. 提取的基于频谱图的特征和模型在ELSDSR、TSP和LibriSpeech数据集上进行了评估,分别达到了96.0%、99.2%和97.6%的加权准确率。3. 所提出的矩形卷积核CNN方法能够有效地从频谱图图像中提取合适的特征,并在ELSDSR、TSP和LibriSpeech数据集的性能评估中超越了多个基线技术。
Keyword:
SPEECH
MACHINES
NOISY
期刊
R
IF:
13.2
论文数:
155
被引数:
3.2K
机构
引用论文
A new classification system for autism based on machine learning of artificial intelligence基于人工智能机器学习的自闭症分类新系统

