arrow
返回

Uncertainty-aware few-shot learning for silent speech decoding

delete2025-09-24
delete0
PRE
AI
S
Srinidhi Kanagachalam
D
Deok‐Hwan Kim *
DOI:10.1016/j.bspc.2025.108700delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
无声语音解码通过利用面部肌肉运动产生的肌电(EMG)信号,为有语音障碍的个体提供通信能力。然而,现有的深度学习模型在处理不确定性方面存在困难,导致泛化能力差,尤其是在数据有限且多样的情况下。本研究旨在开发一种不确定性感知的少样本学习(few-shot learning)方法,以增强无声语音解码的鲁棒性、泛化能力和快速适应性。我们提出了一种创新方法,包含三个核心组件:(i)创建一个动态多口音(Dynamic MultiAccent)数据集,整合多种口音和多样化场景以引入现实世界的可变性;(ii)通过跳跃连接(skip connections)增强转导模型(transduction model),以改善特征传播;(iii)在语音合成器(vocoder)中引入基于变分推断(variational inference)的不确定性感知建模,以有效处理可变性和不确定性。评估结果表明,我们改进的转导模型在公开数据集上相较于当前最优方法表现出更优性能,将词错误率(WER)降低了2.1%。此外,在样本有限的数据集上,所提出的不确定性感知优化方法显著改善了误差校准指标,将期望校准误差(ECE)降低了2.07%,最大校准误差(MCE)降低了2.69%,相较于未引入不确定性感知优化的模型,WER降低了3.67%。该方法有效缓解了不确定性问题,增强了临床环境中无声语音解码的可靠性。本研究为有语音障碍的个体实现无缝且可靠的辅助通信提供了支持,克服了当前无声语音解码中的挑战。

期刊

Biomedical Signal Processing and Control 封面图
Biomedical Signal Processing and Control
IF:
4.9
论文数:
1.0W
被引数:
2.4W

机构

暂无机构信息
引用论文

引用论文

暂无论文信息