返回
摘要
En 中文
在人本多媒体领域,文本驱动的运动生成是一项具有广泛跨场景应用的重要追求。尽管已有显著进展,但现有方法常面临推理延迟与高质量生成之间的权衡问题。为弥补这一差距,我们提出了运动潜在流匹配模型(MotionFlow),一种新颖且强大的运动生成框架。该模型引入了潜在空间中的流匹配算法,仅需单步推理即可实现卓越性能。除文本驱动任务外,我们将方法进一步扩展至可控运动生成。具体而言,我们整合了控制编码器至潜在空间,并将预测的潜在编码解码至运动空间,以支持显式监督,确保合成运动能与输入信号紧密对齐。大量实验表明,我们的MotionFlow不仅在文本驱动任务上超越了当前领先方法,同时在可控运动生成方面也展现出卓越能力。
Keyword:
Human motion generation
flow matching
latent diffusion model
期刊
IF:
9.7
论文数:
4.5K
被引数:
2.4W
机构
引用论文
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video SynthesisFlowVid: 优化不完美的光流以实现一致的视频到视频合成
HMD-Poser: On-Device Real-time Human Motion Tracking from Scalable Sparse ObservationsDai, P.; Zhang, Y.; Liu, T.; Fan, Z.; Du, T.; Su, Z.; Zheng, X.; Li, Z. HMD-Poser: 基于可扩展稀疏观测的设备端实时人体运动跟踪。发表于2024年IEEE/CVF计算机视觉与模式识别会议(CVPR)会议录,美国华盛顿州西雅图,2024年6月16-22日;第874-884页。[Google Scholar][CrossRef]
Yao, F.; Wu, Z.; Yi, L. Full-body motion reconstruction with sparse sensing from graph perspective. In Proceedings of the Thirty-Eighth AAAI Conference on Artificial Intelligence and Thirty-Sixth Conference on Innovative Applications of Artificial Intelligence and Fourteenth Symposium on Educational Advances in Artificial Intelligence, Philadelphia, PA, USA, 25 February–4 March 2025; AAAI Press: Washington, DC, USA, 2024; p. AAAI’24/IAAI’24/EAAI’24. [Google Scholar] [CrossRef]Yao, F.; Wu, Z.; Yi, L. 基于图视角的稀疏感知全身运动重建. 见:第三十八届AAAI人工智能会议暨第三十六届人工智能创新应用会议和第十四届人工智能教育进展研讨会论文集,费城,宾夕法尼亚州,美国,2025年2月25日—3月4日;AAAI Press: 华盛顿特区,美国,2024;页码:AAAI’24/IAAI’24/EAAI’24. [Google Scholar] [CrossRef]

