arrow
Return

A novel single-view point cloud generation model for multimodal spatial representation

delete2026-09-06
delete0
PRE
AI
X
Xinyu Zhou
M
Muge Zhong
J
Jiameng Li
B
Bin Chen *
DOI:10.1016/j.patcog.2026.114649delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• Proposes a 3D spatial perception solution for open urban embodied AI systems. • Solves performance degradation from camera drift and pose variation in real apps. • Designs a spatial-aware architecture with human-like attention and multimodal fusion. • Achieves 40% point cloud quality gain on KITTI with +11.9M params, +30 ms latency.
Keywords:
Embodied intelligence
Points generation
Single-view reconstruction
Multimodal transformer
Spatially sensitive convolution

Journal

Pattern Recognition cover
Pattern Recognition
IF:
7.6
Papers:
1.3W
Citations:
4.5W

Organization

No organization information available