返回
Consistent Zero-Shot Video Editing With Multimodal Feature Flow
DOI:10.1109/OJSP.2026.3691029.png)
摘要
En 中文
我们提出了一种新颖的零样本视频编辑框架,通过加入光流一致性约束来扩展预训练的文本到图像(T2I)模型,以实现时序一致且高质量的视频编辑。通过将光流无缝集成到注意力机制中,我们的方法能够将编辑操作传播到各帧,有效解决了运动和形变等挑战,同时最小化了帧级编辑中常见的伪影。我们方法的关键创新在于其能够基于文本提示和参考图像进行编辑条件设置,从而实现对风格和内容的精确且灵活的控制。它支持多种编辑任务,包括基于文本的编辑、图像到视频的风格迁移以及两者的结合。与现有的(仅文本)视频编辑工具相比,它显著提升了时序一致性和视觉保真度,在零样本设置下实现了最先进的结果。我们的代码可在https://github.com/AviadDahan/MFF获取。
Keyword:
Computer vision
diffusion models
generative models
machine learning
multimodal learning
video editing
zero-shot learning

