返回
Optimizing agricultural classification with masked image modeling
DOI:10.1080/23311932.2025.2462243.png)
摘要
En 中文
图像分类在农业领域提出了重大挑战。然而,由于标注数据稀缺且依赖基于通用数据集训练的预训练模型,视觉Transformer和卷积神经网络等流行算法在众多农业分类任务中表现往往不尽人意。为解决此问题,本研究详细介绍了使用224,228张农业图像对ViTs进行预训练的过程,并采用掩码图像建模进行预处理。该预训练模型随后在三个独立的农业分类数据集上进行微调,其性能优于现有先进方法。例如,该方法在IP102、DeepWeeds和Tsinghua Dogs数据集上分别取得了76.18%、98.49%和88.56%的最高准确率。这种准确率的提升可归因于我们通过大量实验与预训练MIM模型建立的稳健建模策略。该建模策略包括采用先进的MIM模型、将方向梯度直方图特征作为重建目标以及选择合适的掩码比例。我们希望本研究能推动以MIM模型为代表的自监督学习技术在未来广泛应用于各类农业图像相关任务。
Keyword:
Self-supervised learning
masked image modeling
agricultural classification tasks
vision transformer
histogram of oriented gradients feature
期刊
C
IF:
2.3
论文数:
359
被引数:
1
机构
引用论文
Agricultural innovation through deep learning: a hybrid CNN-Transformer architecture for crop disease classification通过深度学习的农业创新:用于作物病害分类的混合CNN-Transformer架构。空间科学杂志,1-32。

