arrow
返回

Balanced multi-modality knowledge mining for RGB-infrared object detection

delete2025-12-02
delete0
PRE
AI
Y
You Ma
张玉成 封面图
张玉成 (Yucheng Zhang)
S
Shihan Mao
柴
柴琳 (Lin Chai) *
Q
Qingling Wang
DOI:10.1016/j.neunet.2025.108421delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
RGB-Infrared目标检测旨在融合两种模态的互补信息以提高检测器的准确性和鲁棒性。鉴于transformer在建模长距离依赖方面的优势,基于transformer的跨模态融合方法不断被提出并取得了令人满意的结果。然而,现有方法面临两大主要挑战:1)难以平衡模态内特定知识与模态间互补知识的挖掘;2)单个注意力层仅建模同一感受野内token特征之间的关系,因此无法捕捉不同尺度对象之间的内在关系,且缺乏同时关注局部和全局信息的能力。为此,我们提出了一种平衡的多模态知识挖掘方法。具体而言,我们设计了一个双注意力知识挖掘(DAKM)模块,通过自注意力和交叉注意力分别显式挖掘模态内和模态间的关键知识。此外,我们将多尺度信息引入DAKM的注意力层,该设计不仅提取多尺度目标特征,还保留了局部和全局信息。随后,我们利用场景感知自适应交互模块融合DAKM获取的模态内和模态间特征。该模块采用差异化和场景信息聚焦于目标相关特征融合。最后,利用跨层特征精炼模块聚合不同融合层以进一步增强特征表示。在多个场景中的大量实验表明,我们的方法优于现有的RGB-Infrared目标检测领域最先进方法。

期刊

Neural Networks 封面图
Neural Networks
IF:
6.3
论文数:
8.2K
被引数:
3.0W

机构

暂无机构信息
引用论文

引用论文

err分享
err收藏
Progressive Critical Region Transfer for Cross-Domain Visual Object Detection
err2024-08-01
err0
PREAI
errWang, Xiaowei; Jiang, Peiwen; Li, Yang; Hu, Manjiang; Gao, Ming; Cao, Dongpu; Ding, Rongjun
err分享
err收藏
Cross-modality interactive attention network for multispectral pedestrian detection用于多光谱行人检测的跨模态交互式注意网络
err2019-10-01
err149
PREAI
errZhang, Lu; Liu, Zhiyong; Zhang, Shifeng; Yang, Xu; Qiao, Hong; Huang, Kaizhu; Hussain, Amir
err分享
err收藏
学者 查看更多内容