Return
A novel single-view point cloud generation model for multimodal spatial representation
DOI:10.1016/j.patcog.2026.114649.png)
Abstract
En 中文
• Proposes a 3D spatial perception solution for open urban embodied AI systems.
• Solves performance degradation from camera drift and pose variation in real apps.
• Designs a spatial-aware architecture with human-like attention and multimodal fusion.
• Achieves 40% point cloud quality gain on KITTI with +11.9M params, +30 ms latency.
Keywords:
Embodied intelligence
Points generation
Single-view reconstruction
Multimodal transformer
Spatially sensitive convolution
Journal
IF:
7.6
Papers:
1.3W
Citations:
4.5W
Organization
No organization information available

