返回
Speed-Aware Audio-Driven Speech Animation using Adaptive Windows
DOI:10.1145/3691341.png)
摘要
En 中文
我们提出了一种新颖的方法,能够利用多个自适应窗口从音频生成逼真的3D人脸语音动画。与使用固定大小音频窗口的先前研究不同,我们的方法接受自适应音频窗口作为输入,以反映音频的语速并使用一致的音位信息。我们的系统由三部分组成。首先,使用以自监督方式训练的神经网络从输入音频中估计语速。其次,根据估计的语速自适应地预测包含音频特征的适当窗口大小。另一个关键要素在于使用不同大小的多个音频窗口作为动画生成器的输入:小窗口用于集中处理详细信息,大窗口用于考虑中心帧附近的广泛音位信息。最后,从多个自适应音频窗口生成语音动画。我们的方法能够从任意语速的现场音频(如快速说唱、慢歌以及正常语音)生成逼真的语音动画。通过包括用户研究在内的广泛定量和定性评估,我们证明了我们的方法优于当前最先进的技术。
Keyword:
Facial animation
lip synchronization
期刊
IF:
9.5
论文数:
4.7K
被引数:
3.6W
机构
引用论文
没有更多内容

