返回
DiffATSM: High quality adaptive tims-scale modification using diffusion-based post-processing
DOI:10.1016/j.csl.2025.101895.png)
摘要
En 中文
• 我们提出DiffATSM,一种创新的基于深度学习的时间尺度修改(TSM)算法,该算法整合了基于扩散的后处理网络。
• 与传统的TSM方法不同,DiffATSM能够自适应地直接从原始波形生成时间调整后的语音,而无需依赖文本信息。
• DiffATSM通过音素后验图(PPG)进行增强,PPG作为辅助信息以保留原始信号的音素结构。
• 我们利用一种后处理网络,该网络采用扩散概率模型来适应具有灵活分布的时间修改。

