arrow
返回

Causal Self-Supervised Pretrained Frontend With Predictive Patterns for Speech Separation

delete2026-01-01
delete0
PRE
AI
W
Wupeng Wang
Z
Zexu Pan
李新科 (Xinke Li)
S
Shuai Wang
H
Haizhou Li *
DOI:10.1109/TASLPRO.2025.3640969delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
语音分离(SS)旨在将多说话人语音混合物解耦为单说话人语音流。尽管SS通常可以通过离线方法实现,但这种处理范式并不适用于实时流式应用。因果分离模型仅依赖过去和当前信息,为实时流式处理提供了一种有前景的解决方案。然而,这些模型通常因缺乏未来上下文而导致性能显著下降。本文介绍了一种新型前端,通过在训练过程中利用预测模式将未来信息隐式地融入因果模型中,旨在缓解训练与运行时推理之间的不匹配。预训练前端采用带有因果卷积编码器的Transformer解码器网络作为骨干,并通过两种创新性的预文本任务进行自监督预训练:自回归混合预测和上下文知识蒸馏。这些任务使模型能够以自监督方式直接从混合物中捕捉预测模式。预训练前端随后作为特征提取器,生成高质量的预测模式。在合成和真实世界数据集上的全面评估验证了所提出的预训练前端的有效性。
Keyword:
Spectrogram
Recurrent neural networks
Mutual information
Feature extraction
Training
Real-time systems
Transformers
Speech processing
Predictive models
Predictive coding
Speech separation
self-supervised learning
teacher-student learning
real-time causal model

期刊

I
IEEE Transactions on Audio Speech and Language Processing
IF:
0
论文数:
151
被引数:
0

机构

T
The Chinese University of Hong Kong, Shenzhen
学者数:
4.3K
论文数: 4.0K
被引数: 7
N
nanjing university
学者数:
7.8W
论文数: 5.6W
被引数: 87
C
city university of hong kong
学者数:
5.8K
论文数: 3.3K
被引数: 2
学者 查看更多机构
引用论文

引用论文

Multi-talker Speech Separation Based on Permutation Invariant Training and Beamforming
err2018-09-02
err0
PREAI
errLu Yin; Ziteng Wang; Risheng Xia; Junfeng Li; Yonghong Yan
err分享
err收藏
err分享
err收藏
Audio Albert: A Lite Bert for Self-Supervised Learning of Audio Representation
err2021-01-19
err0
errOAAI
errPo-Han Chi; Pei-Hung Chung; Tsung-Han Wu; Chun-Cheng Hsieh; Yen-Hao Chen; Shang-Wen Li; Hung-yi Lee
err分享
err收藏
学者 查看更多内容