arrow
返回

Efficient unsupervised segmentation method for continuous Arabic and English speech

delete2026-02-01
delete0
PRE
AI
M
Mait, Hind Ait *
A
Aboutabit, Noureddine
A
Amnay, Meriem
DOI:10.1007/s12243-026-01163-ydelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
语音分割是一项基础任务,涉及将语音信号划分为离散的声学单元,如音素或音节。尽管其重要性,但由于语音模式的固有变异性,精确识别这些单元之间的边界仍然具有挑战性。本研究解决了在不依赖转录数据或任何语言学单元先验知识的情况下进行音素分割的问题。该方法利用了从梅尔频率倒谱系数(MFCC)的一阶导数中提取最大值(即Delta-MFCC),并应用自适应阈值来识别音素边界。这些特征因其能有效捕捉与显著过渡相对应的语音信号动态变化而被选用。与静态特征不同,Delta-MFCC特别适用于表示基于时间的变异,从而能够检测语音信号中的细微变化。该方法的真正优势在于采用了自适应阈值机制。与固定阈值不同,自适应阈值会根据Delta-MFCC中检测到的峰值强度动态调整。生成的边界通过应用于参考语音的匹配技术进行了验证。为评估所提出方法的有效性,使用阿拉伯语和英语语音数据集进行了一系列全面的实验。本方法取得了显著性能,在阿拉伯语和英语中分别实现了96%和85%的F1分数。此外,通过与当前最先进的分割技术进行比较,展示了其在准确分割语音信号方面的优越性。该方法的成功表明其有助于提升语音识别系统,为开发能够处理多样化语音模式的高精度系统做出贡献。
Keyword:
Speech segmentation
Arabic speech
TIMIT
Blind methods
MFCCs
Delta

期刊

Annals of Telecommunications 封面图
Annals of Telecommunications
IF:
2.2
论文数:
89
被引数:
993

机构

I
ibn zohr university of agadir
学者数:
616
论文数: 229
被引数: 0
S
Sultan Moulay Slimane University of Beni Mellal
学者数:
1.9K
论文数: 1.3K
被引数: 2
引用论文

引用论文

err分享
err收藏
Modeling Speech Emotion Recognition via ImageBind representations
err2024-01-01
err0
PREAI
errCHAKHTOUNA,Adil; SEKKATE,Sara; ADIB,Abdellah
err分享
err收藏
学者 查看更多内容