返回
Efficient4D: Fast Dynamic 3D Object Generation from a Single-view Video
DOI:10.1007/s11263-025-02615-z.png)
摘要
En 中文
从单视角视频生成动态3D物体具有挑战性,因为缺乏4D标注数据。一种直观的方法是扩展之前的图像到3D流水线,通过迁移现成的图像生成模型(如score distillation sampling)。然而,这种方法由于需要将信息有限的监督信号反向传播通过大型预训练模型,因此在扩展时会变得缓慢且昂贵。为解决这一问题,我们提出了一个高效的视频到4D物体生成框架Efficient4D。它能在不同相机视角下生成高质量的空间时间一致图像,然后利用这些图像作为标注数据,通过4D Gaussian splatting模型直接重建4D内容。值得注意的是,我们的方法在连续相机轨迹下可实现实时渲染。为在稀疏视角下实现鲁棒重建,我们引入了不一致性感知的置信度加权损失设计,并结合了权重较轻的score distillation损失。在合成视频和真实视频上的大量实验表明,Efficient4D相较于先前的替代方案,在保持新视角合成质量的同时,速度提升了10倍。例如,Efficient4D仅需10分钟即可建模一个动态物体,而先前的Consistent4D模型则需要120分钟。我们的代码和视频结果公开可访问于https://fudan-zvg.github.io/Efficient4D/。
Keyword:
4D Generation
Efficiency
Diffusion Model
Gaussian Splatting
Video
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W

