返回
Cross-modal contrastive learning-based object detection under incomplete modalities
DOI:10.1080/10095020.2026.2633014.png)
摘要
En 中文
目标检测在使用多模态遥感图像时表现出比使用单模态数据更强的性能。然而,在实际应用中,某些区域可能缺少特定模态数据,这限制了多模态目标检测方法的应用。为解决这一挑战,本文提出了一种跨模态对比学习和知识蒸馏(CCLKD)方法。CCLKD由针对易检测和难检测模态的双分支组成。在CCLKD训练过程中,它采用知识蒸馏策略,通过从易检测分支(教师网络)转移知识来增强难检测分支(学生网络)的性能。因此,当易检测模态缺失时,CCLKD仅使用难检测模态数据仍能获得良好的检测性能。为更有效地增强难检测模态的表示能力,CCLKD引入了基于自适应温度的知识蒸馏(ATKD)策略和类别约束对比学习(CCL)机制。ATKD根据教师网络提供的预测概率动态调整蒸馏温度,并提供逻辑级、特征级和关系级蒸馏。CCL在增强同类实例间相似性的同时抑制不同类别的干扰,从而提高特征空间中的类内紧致性和类间可分性。我们采用了三个标准目标检测数据集,并将CCLKD与当前先进方法进行比较以验证其性能。实验结果证明了CCLKD各组件的有效性,并通过定性和视觉比较进一步验证了其优于现有方法的优越性。
Keyword:
Feature alignment
object detection
contrastive learning
category-level information
期刊
G
IF:
5.5
论文数:
875
被引数:
2.4K
机构
引用论文
SeaDATE: Remedy Dual-Attention Transformer with Semantic Alignment via Contrast Learning for Multimodal Object Detection董, S.; 李, Y.; 谢, W.; 张, J.; 田, J.; 杨, D.; 雷杰. SeaDATE: 通过对比学习进行语义对齐,修复双注意力Transformer用于多模态目标检测. arXiv 2024, arXiv:2410.11358. [Google Scholar] [CrossRef]
Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks更快的r-cnn: 基于区域建议网络的实时目标检测
Drone-Based RGB-Infrared Cross-Modality Vehicle Detection Via Uncertainty-Aware Learning基于不确定感知学习的无人机RGB红外跨模态车辆检测
A Lightweight Network Based on YOLOv8 for Improving Detection Performance and the Speed of Thermal Image Processing基于YOLOv8的轻量级网络,用于提高热图像处理的检测性能和速度
ELECTRONICS
IF2.6
Illumination-Aware Multimodal Hierarchical Fusion Network for RGB-Infrared Object Detection照明感知的多模态分层融合网络用于RGB-红外目标检测

