arrow
返回

LaSSM: Efficient Semantic-Spatial Query Decoding via Local Aggregation and State Space Models for 3D Instance Segmentation

delete2026-02-16
delete0
PRE
AI
L
Lei Yao
Y
Yi Wang
Y
Yawen Cui
M
Moyun Liu
L
Lap‐Pui Chau
DOI:10.1109/TCSVT.2026.3664837delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
基于查询的点云3D场景实例分割已取得显著性能。然而,现有方法由于点云的稀疏特性导致查询初始化困境,并依赖计算密集型的注意力机制于查询解码器中。为此,我们引入LaSSM,在保持竞争性性能的同时优先考虑简洁性和效率。具体而言,我们提出一种层次化语义-空间查询初始化器,通过综合考虑语义线索和空间分布从超点推导查询集,实现全面的场景覆盖和加速收敛。我们进一步提出一种坐标引导的状态空间模型(SSM)解码器,用于逐步优化查询。该新型解码器具有局部聚合方案,使模型专注于几何一致区域,并通过空间双路径SSM块整合关联坐标信息,捕捉查询集内的潜在依赖关系。我们的设计实现了高效的实例预测,避免了噪声信息的引入并减少了冗余计算。LaSSM在最新的ScanNet++ V2排行榜上排名第一,以仅1/3的浮点运算次数超越先前最佳方法2.5%的mAP,证明了其在具有挑战性的大规模场景实例分割中的优越性。LaSSM在ScanNet V2、ScanNet200、S3DIS和ScanNet++ V1基准测试上也取得了具有竞争力的性能,且计算成本更低。广泛的消融研究和定性结果验证了我们的设计有效性。代码和权重可在https://github.com/RayYoh/LaSSM获取。
Keyword:
Point clouds
3D instance segmentation
state space model
query decoder

期刊

IEEE Transactions on Circuits and Systems for Video Technology 封面图
IEEE Transactions on Circuits and Systems for Video Technology
IF:
11.1
论文数:
624
被引数:
3.1W

机构

T
the hong kong polytechnic university
学者数:
5.2K
论文数: 2.9K
被引数: 0
H
huazhong university of science and technology
学者数:
2.7W
论文数: 8.0K
被引数: 5
引用论文

引用论文

暂无论文信息