arrow
返回

DiffATSM: High quality adaptive tims-scale modification using diffusion-based post-processing

delete2025-10-15
delete0
PRE
AI
S
Sohee Jang
Y
Yeon-Ju Kim
J
Joon‐Hyuk Chang *
DOI:10.1016/j.csl.2025.101895delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 我们提出DiffATSM,一种创新的基于深度学习的时间尺度修改(TSM)算法,该算法整合了基于扩散的后处理网络。 • 与传统的TSM方法不同,DiffATSM能够自适应地直接从原始波形生成时间调整后的语音,而无需依赖文本信息。 • DiffATSM通过音素后验图(PPG)进行增强,PPG作为辅助信息以保留原始信号的音素结构。 • 我们利用一种后处理网络,该网络采用扩散概率模型来适应具有灵活分布的时间修改。

期刊

C
computer speech & language
IF:
0
论文数:
43
被引数:
0

机构

暂无机构信息
引用论文

引用论文

暂无论文信息