arrow
返回

AttriMOT: Semantic-Aware Multimodal 3D Multi-Object Tracking with Attribute-Level Alignment

delete2026-05-01
delete0
PRE
AI
Y
Youlin Liu
M
Mohammad Faidzul Nasrudin
Z
Zainal Rasyid Mahayuddin *
DOI:10.3390/sym18060907delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
复杂动态环境下的3D多目标跟踪(MOT)由于传感器模态的时间变化可靠性、严重的遮挡以及难以区分外观相似的实例而仍然具有挑战性。现有方法主要依赖于粗粒度的类别级语义或启发式多模态融合策略,这限制了细粒度实例区分,并在复杂场景下导致轨迹关联不稳定。此外,当前的3D MOT框架通常缺乏利用属性级语义信息进行稳健跟踪和语义感知目标检索的能力。为解决这些局限性,我们提出了AttriMOT,一个语义感知的多模态3D MOT框架。具体而言,引入了类别语义锚定和竞争抑制机制,以保留视觉相似实例间的判别性细粒度属性信息。属性级多模态对齐模块在3D几何、2D外观和文本语义之间建立结构化对应关系,实现了稳健的跨模态表示学习。此外,一种参数自由的适应性置信度融合策略动态平衡LiDAR和相机衍生的轨迹置信度,以改善不同环境条件下的跟踪稳定性。此外,设计了一个语义感知的轨迹选择器,以支持文本指定的目标检索和轨迹锁定,实现了可控的语义引导3D跟踪。在具有挑战性的3D MOT基准上的广泛实验表明,AttriMOT在跟踪精度和鲁棒性方面持续优于当前最佳方法。特别是,AttriMOT相比现有最佳方法在HOTA上提升了1.33%,在MOTA上提升了0.54%,同时提供了增强的语义可控性和文本引导跟踪能力。
Keyword:
MOT
VLMs
multimodal

期刊

S
Symmetry-Basel
IF:
2.2
论文数:
1.4K
被引数:
0

机构

U
Universiti Kebangsaan Malaysia
学者数:
274
论文数: 102
被引数: 0
引用论文

引用论文

暂无论文信息