返回
Deep Learning System for Speech Command Recognition
DOI:10.3390/electronics14193793.png)
摘要
En 中文
我们提出了一种用于英语语音命令识别的深度学习模型。该数据集基于Warden P.的Google Speech Commands Dataset(版本0.01),包含十个不同的命令(“left”、“right”、“go”、“stop”、“up”、“down”、“on”、“off”、“yes”和“no”),以及额外的“silence”和“unknown”类别。数据集以说话人无关的方式划分,其中70%的说话人分配给训练集,15%分别分配给测试集和验证集。所有音频片段均以16 kHz采样,共计46 146个片段。音频文件转换为Mel频谱图表示,随后作为由四层卷积神经网络和两层全连接层组成的深度学习模型的输入。该模型采用整流线性单元(ReLU)激活函数、Adam优化器和dropout正则化以提高泛化能力。达到的测试准确率为96.05%。报告了95%的微观和宏观平均精确率、召回率和F1分数以反映各类别性能,并提供了混淆矩阵。所提出的模型已部署在Raspberry Pi 5上作为雾计算设备,用于实时语音识别应用。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

