arrow
返回

Spectrogram Features-Based Automatic Speaker Identification For Smart Services

delete2025-02-19
delete0
delete
OA
AI
R
Rashid Jahangir
M
Mohammed Alreshoodi *
F
Fawaz Khaled Alarfaj
DOI:10.1080/08839514.2025.2459476delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
自动语音识别(ASI)是一个引人入胜的研究领域,具有广泛的应用,如监控、语音认证、身份验证和电子语音窃听。本研究探讨了基于从频谱图图像中提取的特征,通过使用矩形卷积核的卷积神经网络(CNN)进行自动语音识别。传统上,CNN采用方形卷积核和各层的最大池化操作,这是一种针对2D数据优化的设计。然而,在处理频谱图时,信息编码方式略有不同。频率沿y轴显示,x轴表示音频的时间。振幅由频谱图图像中特定点的强度表示。本研究的主要贡献如下:1. 为了有效分析音频信号,本研究提出了使用不同大小和形状的矩形卷积核提取频谱特征,以提升语音识别系统的识别精度,从而获得更具区分性的特征。2. 提取的基于频谱图的特征和模型在ELSDSR、TSP和LibriSpeech数据集上进行了评估,分别达到了96.0%、99.2%和97.6%的加权准确率。3. 所提出的矩形卷积核CNN方法能够有效地从频谱图图像中提取合适的特征,并在ELSDSR、TSP和LibriSpeech数据集的性能评估中超越了多个基线技术。
Keyword:
SPEECH
MACHINES
NOISY

期刊

R
Radiology and Artificial Intelligence
IF:
13.2
论文数:
155
被引数:
3.2K

机构

Q
Qassim University
学者数:
5.7K
论文数: 5.5K
被引数: 5.0K
K
king faisal university (kfu)
学者数:
3
论文数: 3
被引数: 0
C
COMSATS University Islamabad
学者数:
722
论文数: 392
被引数: 0
学者 查看更多机构
引用论文

引用论文

Speaker recognition with hybrid features from a deep belief network
err2016-08-17
err0
errOAAI
errHazrat Ali; Son N. Tran; Emmanouil Benetos; Artur S. d’Avila Garcez
err分享
err收藏
Speaker Recognition by Machines and Humans
err2015-11-01
err464
PREAI
errHansen, John H. L.; Hasan, Taufiq
err分享
err收藏
Speaker Verification Using Adapted Gaussian Mixture Models
err2000-01-01
err0
errOAAI
errDouglas A. Reynolds; Thomas F. Quatieri; Robert B. Dunn
err分享
err收藏
Convolutional neural network-based cross-corpus speech emotion recognition with data augmentation and features fusion
err2022-03-28
err0
PREAI
errRashid Jahangir; Ying Wah Teh; Ghulam Mujtaba; Roobaea Alroobaea; Zahid Hussain Shaikh; Ihsan Ali
err分享
err收藏
Speaker identification security improvement by means of speech watermarking
err2007-11-01
err32
PREAI
errFaundez-Zanuy, Marcos; Hagmueller, Martin; Kubin, Gernot
err分享
err收藏
学者 查看更多内容