Skip to main content
QUICK REVIEW

[论文解读] MangoLeafBD: A Comprehensive Image Dataset to Classify Diseased and Healthy Mango Leaves

Sarder Iftekhar Ahmed, Muhammad Ibrahim|arXiv (Cornell University)|Aug 27, 2022
Phytoplasmas and Hemiptera pathogens被引用 6
一句话总结

本文介绍了MangoLeafBD,这是首个公开可用的、标准的芒果叶图像数据集,包含来自孟加拉国的4,000张芒果叶图像,涵盖七种病害和健康叶片。该研究评估了三种深度学习模型——自定义CNN、ResNet50和CNN-SVM,取得了高精度、高召回率和高F1分数,为农业中自动化芒果病害检测提供了宝贵的基准。

ABSTRACT

Agriculture is of one of the few remaining sectors that is yet to receive proper attention from the machine learning community. The importance of datasets in the machine learning discipline cannot be overemphasized. The lack of standard and publicly available datasets related to agriculture impedes practitioners of this discipline to harness the full benefit of these powerful computational predictive tools and techniques. To improve this scenario, we develop, to the best of our knowledge, the first-ever standard, ready-to-use, and publicly available dataset of mango leaves. The images are collected from four mango orchards of Bangladesh, one of the top mango-growing countries of the world. The dataset contains 4000 images of about 1800 distinct leaves covering seven diseases. Although the dataset is developed using mango leaves of Bangladesh only, since we deal with diseases that are common across many countries, this dataset is likely to be applicable to identify mango diseases in other countries as well, thereby boosting mango yield. This dataset is expected to draw wide attention from machine learning researchers and practitioners in the field of automated agriculture.

研究动机与目标

  • 为解决机器学习中芒果叶病害分类缺乏标准化、公开可用数据集的问题。
  • 开发一个全面、高质量的孟加拉国芒果叶图像数据集,真实反映农业实际条件。
  • 为训练和评估深度学习模型在植物病害检测中的应用提供基准,尤其针对芒果。
  • 通过聚焦于芒果种植区普遍存在的病害,提升模型的全球适用性,而非局限于孟加拉国。
  • 通过提供一个精心整理、即用型的数据集,促进可重复实验,推动自动化农业研究。

提出的方法

  • 从孟加拉国四个果园收集了4,000张芒果叶图像,涵盖1,800片独立叶片和七种类别的病害。
  • 采用严格的数据清洗、预处理及数据增强技术(缩放、剪切、缩放、翻转),使用TensorFlow的ImageDataGenerator实现。
  • 设计了一个包含五个卷积层(64、64、128、128、256个滤波器)、ReLU激活函数、三个最大池化层和一个512个神经元的全连接层的自定义CNN。
  • 使用Keras/TensorFlow实现ResNet50,包含48个卷积层,通过残差连接缓解梯度消失问题,并使用预训练参数。
  • 构建了一个混合型CNN-SVM模型,包含五个卷积层、ReLU激活函数、最大池化、两个全连接层(512个神经元),以及一个SVM输出层。
  • 所有模型均使用分类交叉熵损失(CNN、ResNet50)和平方合页损失(CNN-SVM),采用Adam优化器,批量大小为128,训练100个周期,使用Google Colab的GPU进行训练。

实验结果

研究问题

  • RQ1大规模、公开可用且标准化的芒果叶图像数据集能否提升植物病害检测模型的性能与可重复性?
  • RQ2不同深度学习架构——自定义CNN、ResNet50和CNN-SVM——在分类多种芒果叶病害及健康叶片方面的表现如何?
  • RQ3数据增强在有限但多样化的芒果叶数据集上,对模型泛化能力和性能的提升程度如何?
  • RQ4基于单一国家(孟加拉国)开发的数据集,是否能在具有相似病理特征的其他芒果种植区有效用于病害分类?
  • RQ5当应用于这一新领域特定数据集时,最先进模型的精确率、召回率和F1分数指标是多少?

主要发现

  • MangoLeafBD数据集包含来自孟加拉国四个果园的4,000张图像,涵盖1,800片独立芒果叶,覆盖七种病害类别和健康叶片。
  • 自定义CNN模型在所有类别上均实现了高精确率、高召回率和高F1分数,表现出色。
  • ResNet50在分类准确率方面优于自定义CNN和CNN-SVM,其残差连接有效缓解了梯度消失问题。
  • CNN-SVM混合模型表现出具有竞争力的性能,表明结合特征提取与最大间隔分类器可提升泛化能力。
  • 数据增强显著扩大了有效训练集,提升了所有模型的鲁棒性并减少了过拟合。
  • 该数据集公开可用,专为即用型研究设计,为未来自动化芒果病害检测研究奠定了基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。