返回
A scalable multi-modal learning fruit detection algorithm for dynamic environments
DOI:10.3389/fnbot.2024.1518878.png)
摘要
En 中文
引言
为提升自然场景下荔枝果实的检测效果,解决密集遮挡和小目标识别等挑战,本文提出一种新型多模态目标检测方法,命名为YOLOv5-Litchi。
方法
首先,通过将YOLOv5s的Neck层网络结构从FPN+PAN简化为FPN结构,并将检测头数量从3个增至5个。此外,将分辨率分别为80×80像素和160×160像素的检测头替换为TSCD检测头,以增强模型对小目标的检测能力。随后,将定位损失函数替换为EIoU损失函数,并将置信度损失替换为VFLoss,以进一步提升检测框的精度并降低遮挡目标的漏检率。进一步采用滑动切片方法预测图像目标,从而减少小目标的漏检率。
结果
实验结果表明,与原始YOLOv5s模型相比,所提模型在准确率、召回率和平均精度均值(mAP)上分别提升了9.5、0.9和12.3个百分点。在与YOLOx、YOLOv6和YOLOv8等其他模型的对比中,所提模型的AP值分别提升了4.0、6.3和3.7个百分点。
讨论
改进后的网络展现出显著提升,主要聚焦于增强召回率和AP值,从而降低漏检率,表现为更少的漏检目标数和更精确的预测框,表明其适用于荔枝果实检测。因此,该方法显著提高了成熟荔枝果实的检测精度,有效解决了密集遮挡和小目标检测的挑战,为后续荔枝产量估算提供了关键技术支持。
Keyword:
multi-modal learning
machine learning
fruit recognition
deep learning
objective detection
期刊
IF:
2.8
论文数:
165
被引数:
4.1K
机构
暂无机构信息
引用论文
Hierarchical feature representation and multimodal fusion with deep learning for AD/MCI diagnosis
NeuroImage
IF0
Enhancing Emergency Vehicle Detection: A Deep Learning Approach with Multimodal Fusion增强应急车辆检测:一种基于多模态融合的深度学习方法
Mathematics
IF0

