arrow
返回

Consistent Zero-Shot Video Editing With Multimodal Feature Flow

delete2026-05-05
delete0
delete
OA
AI
A
Aviad Dahan
E
Eyal Gomel
L
Lior Wolf
R
Raja Giryes
DOI:10.1109/OJSP.2026.3691029delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
我们提出了一种新颖的零样本视频编辑框架,通过加入光流一致性约束来扩展预训练的文本到图像(T2I)模型,以实现时序一致且高质量的视频编辑。通过将光流无缝集成到注意力机制中,我们的方法能够将编辑操作传播到各帧,有效解决了运动和形变等挑战,同时最小化了帧级编辑中常见的伪影。我们方法的关键创新在于其能够基于文本提示和参考图像进行编辑条件设置,从而实现对风格和内容的精确且灵活的控制。它支持多种编辑任务,包括基于文本的编辑、图像到视频的风格迁移以及两者的结合。与现有的(仅文本)视频编辑工具相比,它显著提升了时序一致性和视觉保真度,在零样本设置下实现了最先进的结果。我们的代码可在https://github.com/AviadDahan/MFF获取。
Keyword:
Computer vision
diffusion models
generative models
machine learning
multimodal learning
video editing
zero-shot learning

期刊

IEEE Open Journal of Signal Processing 封面图
IEEE Open Journal of Signal Processing
IF:
2.7
论文数:
153
被引数:
535

机构

T
tel aviv university
学者数:
5.8K
论文数: 2.2K
被引数: 1
引用论文

引用论文

暂无论文信息