arrow
返回

Fusion-Mamba for Cross-Modality Object Detection

delete2025-01-01
delete0
PRE
AI
W
Wenhao Dong
H
Haodong Zhu
林绍辉 (Shaohui Lin)
X
Xiaoyan Luo
Y
Yunhang Shen
G
Guodong Guo
张宝昌 (Baochang Zhang)
DOI:10.1109/TMM.2025.3599020delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
跨模态目标检测旨在融合不同模态的互补信息以提高模型性能,从而实现更广泛的应用。然而,基于CNN或Transformer的传统跨模态融合方法未能充分解决伪目标信息问题,导致模型注意力分散,进而降低目标检测性能。本文研究了一种新颖的跨模态融合方法,通过基于改进的Mamba与门控注意力机制的隐藏状态空间关联跨模态特征。我们提出了(FMB),其设计用于将跨模态特征映射到隐藏状态空间进行交互,从而优化模型对真实目标区域的注意力并提升整体性能。FMB包含两个关键模块:状态空间通道交换(SSCS)模块,用于促进浅层特征融合;双状态空间融合(DSSF)模块,用于实现深度融合,并在隐藏状态空间中有效抑制伪目标信息。我们提出的方法优于当前最优方法,在M³FD、DroneVehicle和FLIR-Aligned数据集上的mAP分别提升了5.9%、3.5%和2.1%。据我们所知,本研究为跨模态目标检测建立了新的基准,为该领域未来的研究提供了坚实基础。
Keyword:
Cross-modality
feature fusion
multi-spectral object detection
mamba

期刊

IEEE Transactions on Multimedia 封面图
IEEE Transactions on Multimedia
IF:
9.7
论文数:
4.5K
被引数:
2.4W

机构

B
Beihang University
学者数:
5.2W
论文数: 4.1W
被引数: 37
E
east china normal university
学者数:
3.1W
论文数: 2.1W
被引数: 25
T
tencent youtu lab
学者数:
19
论文数: 12
被引数: 0
E
Eastern Institute of Technology
学者数:
683
论文数: 450
被引数: 825
学者 查看更多机构
引用论文

引用论文

暂无论文信息