返回
Causal Self-Supervised Pretrained Frontend With Predictive Patterns for Speech Separation
DOI:10.1109/TASLPRO.2025.3640969.png)
摘要
En 中文
语音分离(SS)旨在将多说话人语音混合物解耦为单说话人语音流。尽管SS通常可以通过离线方法实现,但这种处理范式并不适用于实时流式应用。因果分离模型仅依赖过去和当前信息,为实时流式处理提供了一种有前景的解决方案。然而,这些模型通常因缺乏未来上下文而导致性能显著下降。本文介绍了一种新型前端,通过在训练过程中利用预测模式将未来信息隐式地融入因果模型中,旨在缓解训练与运行时推理之间的不匹配。预训练前端采用带有因果卷积编码器的Transformer解码器网络作为骨干,并通过两种创新性的预文本任务进行自监督预训练:自回归混合预测和上下文知识蒸馏。这些任务使模型能够以自监督方式直接从混合物中捕捉预测模式。预训练前端随后作为特征提取器,生成高质量的预测模式。在合成和真实世界数据集上的全面评估验证了所提出的预训练前端的有效性。
Keyword:
Spectrogram
Recurrent neural networks
Mutual information
Feature extraction
Training
Real-time systems
Transformers
Speech processing
Predictive models
Predictive coding
Speech separation
self-supervised learning
teacher-student learning
real-time causal model
期刊
I
IF:
0
论文数:
151
被引数:
0
机构
引用论文
HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units休伯特: 通过隐藏单元的掩蔽预测进行自我监督的语音表示学习

