返回
DiffPortraitVideo: Diffusion-Based Expression-Consistent Zero-Shot Portrait Video Translation
DOI:10.1109/TVCG.2025.3642300.png)
摘要
En 中文
零样本文本到视频扩散模型旨在将预训练的图像扩散模型扩展到视频领域,而无需额外训练。近期,主流技术通常依赖现有形状作为约束,并引入帧间注意力以确保纹理一致性。然而,此类形状约束往往会限制视频的风格化几何变形,并无意中忽略了原始纹理特征。此外,现有方法还存在闪烁和不一致的面部表情问题。在本文中,我们提出DiffPortraitVideo。该框架采用基于扩散模型的特征和注意力注入机制生成关键帧,通过跨帧约束来强制一致性,并通过自适应特征融合来确保表情一致性。我们的方法在保持文本和原始图像属性的同时,实现了高时空和表情一致性。进行了广泛而全面的实验来验证我们提出的框架在生成个性化、高质量且连贯视频方面的有效性。这不仅展示了我们的方法优于现有方法的优越性,也为文本到视频生成领域在增强个性化和质量方面的进一步研究和开发铺平了道路。
Keyword:
Portrait video translation
2D diffusion models
attention mechanism
期刊
IF:
6.5
论文数:
309
被引数:
2.2W

