返回
Text-Guided Diffusion with Spectral Convolution for 3D Human Pose Estimation
DOI:10.1111/cgf.70263.png)
摘要
En 中文
尽管基于单目视频的3D人体姿态估计领域已取得显著进展,但现有方法缺乏对精细粒度高层先验知识的指导,例如动作语义和相机视角,导致在视觉特征严重缺失的场景(即复杂遮挡情况下)的姿态重建精度面临重大挑战。我们认识到3D人体姿态估计任务本质上构成一个典型逆问题,并提出一种基于运动语义的扩散(MS-Diff)框架,通过融合高层运动语义与频谱特征正则化来消除复杂场景中的干扰噪声并提升估计精度。具体而言,我们设计了一个多模态扩散交互(MDI)模块,将包括动作类别和相机视角在内的运动语义融入扩散过程,通过跨模态机制建立语义-视觉特征对齐以解决姿态歧义并有效处理遮挡。此外,我们利用频谱卷积正则化(SCR)模块,在频域内实施自适应滤波以选择性抑制噪声成分。在大型公开数据集Human3.6M和MPI-INF-3DHP上的广泛实验表明,我们的方法取得了当前最佳的性能。
Keyword:
CCS Concepts
• Computing methodologies → Activity recognition and understanding

