arrow
返回

Generating Video with Conditional Control Diffusion Model

delete2026-01-01
delete0
PRE
AI
G
Gao, XiaoYang
W
Wen, Zheng
Y
Yang, Tao *
DOI:10.1007/978-981-95-4821-7_7delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
我们提出了一种条件控制扩散模型(CCDM),这是一种通过使用条件控制将文本到图像(T2I)模型转换为视频模型的神经网络,同时保持原始模型图像质量。CCDM首先在真实视频数据上进行训练,创建一个复合模型以融合多个帧并学习动作先验。然后,CCDM采用Stable Diffusion架构,并整合T2I模型,确保在视频生成过程中不改变T2I模型。最后,CCDM将生成的帧反馈给模型作为反馈,减少因内容变化引起的闪烁。我们在CivitAI上的不同风格和特征的T2I模型上测试了CCDM。使用T2I模型网站的提示,我们生成视频并表明CCDM可以生成动态信息,并处理需要8GB VRAM的生成任务。CCDM在视频生成应用方面具有优异的潜力。
Keyword:
Diffusion Model
Video Generation
Conditional Control
Computer Vision
Text-to-Image

期刊

A
ARTIFICIAL INTELLIGENCE AND ROBOTICS, ISAIR 2025, PT I
IF:
0
论文数:
26
被引数:
0

机构

U
University of Sanya
学者数:
190
论文数: 162
被引数: 1
引用论文

引用论文

VQGAN-CLIP: Open Domain Image Generation and Editing with Natural Language Guidance
err2022-10-22
err0
errOAAI
errKatherine Crowson; Stella Biderman; Daniel Kornis; Dashiell Stander; Eric Hallahan; Louis Castricato; Edward Raff
err分享
err收藏
CLIP-Adapter: Better Vision-Language Models with Feature AdaptersCLIP-Adapter: 具有功能适配器的更好的视觉语言模型
err2023-09-15
err98
PREAI
errGao, Peng; Geng, Shijie; Zhang, Renrui; Ma, Teli; Fang, Rongyao; Zhang, Yongfeng; Li, Hongsheng; Qiao, Yu
err分享
err收藏
学者 查看更多内容