返回
Synchronized Multi-Frame Diffusion for Temporally Consistent Video Stylization
DOI:10.1111/cgf.70095.png)
摘要
En 中文
文本引导的视频到视频风格化根据文本提示将源视频的视觉外观转换为不同的外观。现有的文本引导图像扩散模型可以扩展用于风格化视频合成。然而,它们难以生成既具有高度详细外观又具有时间一致性的视频。在本文中,我们提出了一种同步多帧扩散框架,以保持视觉细节和时间一致性。帧以同步方式去噪,更重要的是,不同帧的信息从去噪过程开始就被共享。这种信息共享确保了在去噪过程的早期阶段就能达成关于整体结构和颜色分布的共识,以免为时已晚。原始视频的光流作为连接和帧间信息共享的媒介。我们在大量实验中展示了我们方法在生成高质量和多样化结果方面的有效性。与当前最先进的视频编辑方法相比,我们的方法显示出更优越的定性和定量结果。
期刊
IF:
2.9
论文数:
565
被引数:
1.1W
机构
引用论文
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video SynthesisFlowVid: 优化不完美的光流以实现一致的视频到视频合成
UniTune: Text-Driven Image Editing by Fine Tuning a Diffusion Model on a Single ImageUniTune: 通过微调单个图像上的扩散模型进行文本驱动的图像编辑
MeDM: Mediating Image Diffusion Models for Video-to-Video Translation with Temporal Correspondence GuidanceMeDM:基于时序对应引导的视频到视频翻译中介图像扩散模型

