返回
Balanced multi-modality knowledge mining for RGB-infrared object detection
DOI:10.1016/j.neunet.2025.108421.png)
摘要
En 中文
RGB-Infrared目标检测旨在融合两种模态的互补信息以提高检测器的准确性和鲁棒性。鉴于transformer在建模长距离依赖方面的优势,基于transformer的跨模态融合方法不断被提出并取得了令人满意的结果。然而,现有方法面临两大主要挑战:1)难以平衡模态内特定知识与模态间互补知识的挖掘;2)单个注意力层仅建模同一感受野内token特征之间的关系,因此无法捕捉不同尺度对象之间的内在关系,且缺乏同时关注局部和全局信息的能力。为此,我们提出了一种平衡的多模态知识挖掘方法。具体而言,我们设计了一个双注意力知识挖掘(DAKM)模块,通过自注意力和交叉注意力分别显式挖掘模态内和模态间的关键知识。此外,我们将多尺度信息引入DAKM的注意力层,该设计不仅提取多尺度目标特征,还保留了局部和全局信息。随后,我们利用场景感知自适应交互模块融合DAKM获取的模态内和模态间特征。该模块采用差异化和场景信息聚焦于目标相关特征融合。最后,利用跨层特征精炼模块聚合不同融合层以进一步增强特征表示。在多个场景中的大量实验表明,我们的方法优于现有的RGB-Infrared目标检测领域最先进方法。
期刊
IF:
6.3
论文数:
8.2K
被引数:
3.0W
机构
暂无机构信息
引用论文
CMIGNet: Cross-Modal Inverse Guidance Network for RGB-Depth salient object detectionCMIGNet: 用于RGB深度显著目标检测的跨模态逆制导网络
PATTERN RECOGNITION
IF7.6
Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks更快的r-cnn: 基于区域建议网络的实时目标检测
Improving RGB-infrared object detection with cascade alignment-guided transformer利用级联对准制导变压器改进RGB红外目标检测
INFORMATION FUSION
IF15.5
Rethinking the necessity of image fusion in high-level vision tasks: A practical infrared and visible image fusion network based on progressive semantic injection and scene fidelity
INFORMATION FUSION
IF15.5
Cross-modality interactive attention network for multispectral pedestrian detection用于多光谱行人检测的跨模态交互式注意网络
INFORMATION FUSION
IF15.5
Image fusion in the loop of high-level vision tasks: A semantic-aware real-time infrared and visible image fusion network高级视觉任务循环中的图像融合: 语义感知的实时红外和可见光图像融合网络
INFORMATION FUSION
IF15.5
MMI-Det: Exploring Multi-Modal Integration for Visible and Infrared Object DetectionZeng, Y.; Liang, T.; Jin, Y.; Li, Y. MMI-Det: 探索可见光与红外目标检测的多模态融合。IEEE Trans. Circuits Syst. Video Technol. 2024, 34, 11198–11213. [Google Scholar] [CrossRef]

