返回
Voxel-to-pillar: A height-aware pillar feature encoding method for efficient 3D object detection
DOI:10.1016/j.ins.2025.123014.png)
摘要
En 中文
精确的3D目标检测对于自动驾驶系统至关重要,其中LiDAR点云为鲁棒感知提供了精确的空间信息。由于密集体素化(sparse convolution),现有的基于体素的检测器能够有效捕捉空间结构,但计算成本高且内存密集。相比之下,基于基柱(pillar-based)的检测器提供轻量级架构和快速推理,适用于实际部署。然而,它们通过将z轴压缩为2D表示而严重损失高度信息,限制了准确性,尤其是对于行人等小尺寸、高度变化的物体。本文提出了一种新颖的高度感知基柱编码方法Voxel-to-Pillar (V2P),它结合了体素化精细的3D空间结构表达能力与基于基柱检测的计算效率。V2P首先将点云划分为体素,并进行轻量级3D特征提取以构建3D空间结构信息。这些体素特征通过轻量级体素融合模块沿垂直维度聚合,形成增强的基柱特征,保留关键高度线索。V2P是模块化、轻量级的,且与现有基于基柱的检测器兼容,无需修改骨干网络。将其集成到VoxelNeXt-2D框架中作为V2P-Pillar时,在Waymo Open Dataset上实现了显著性能提升,特别是在行人检测方面,其按朝向加权平均精度有显著改善。代码:https://github.com/kaikailab/V2P-Pillar.
Keyword:
3D object detection
Point clouds
Height-aware feature encoding
Autonomous driving
期刊
IF:
6.8
论文数:
540
被引数:
6.2W

