Skip to main content
QUICK REVIEW

[论文解读] Facilitated machine learning for image-based fruit quality assessment

Manuel Knott, Fernando Pérez‐Cruz|arXiv (Cornell University)|Jul 10, 2022
Smart Agriculture and AI被引用 6
一句话总结

本文提出了一种简化、无需GPU的机器学习方法,用于基于图像的水果品质评估,采用预训练的视觉变换器(ViTs),特别是DINO ViT,作为即用型特征提取器。该方法仅使用三分之一的训练数据,即达到与微调卷积神经网络(CNNs)相当的分类准确率,误差在1%以内,从而实现在去中心化产后供应链中的低资源部署。

ABSTRACT

Image-based machine learning models can be used to make the sorting and grading of agricultural products more efficient. In many regions, implementing such systems can be difficult due to the lack of centralization and automation of postharvest supply chains. Stakeholders are often too small to specialize in machine learning, and large training data sets are unavailable. We propose a machine learning procedure for images based on pre-trained Vision Transformers. It is easier to implement than the current standard approach of training Convolutional Neural Networks (CNNs) as we do not (re-)train deep neural networks. We evaluate our approach based on two data sets for apple defect detection and banana ripeness estimation. Our model achieves a competitive classification accuracy equal to or less than one percent below the best-performing CNN. At the same time, it requires three times fewer training samples to achieve a 90% accuracy.

研究动机与目标

  • 解决在数据和计算能力有限的去中心化、低资源产后供应链中部署机器学习的挑战。
  • 克服从零开始训练或微调卷积神经网络(CNNs)所需的高数据和硬件需求。
  • 证明预训练的视觉变换器可作为无需微调的高效即用型特征提取器,适用于水果品质评估任务。
  • 使小型利益相关者(如冷链运营商和农民合作社)能够利用智能手机图像采用基于AI的品质评估技术。
  • 通过降低计算需求并提升农业AI应用的包容性,推动绿色AI发展。

提出的方法

  • 将自监督预训练的视觉变换器(DINO ViT-S/8 和 DINO ViT-B/8)用作固定特征提取器,不对其进行领域数据的微调。
  • 从ViT编码器的最后层提取图像嵌入,并通过主成分分析(PCA)降低维度。
  • 在PCA降维后的ViT特征上训练简单轻量的分类器(如SVM或逻辑回归),用于分类任务。
  • 在两个真实世界数据集上评估性能:苹果缺陷检测(CASC IFW)和香蕉成熟度估计。
  • 将结果与在相同数据上微调的最先进CNN模型(ResNet50、VGG-11)进行对比,采用相同的评估协议。
  • 使用PCA可视化特征分布,分析类别可分性和对噪声及背景变化的鲁棒性。

实验结果

研究问题

  • RQ1在数据量有限的情况下,预训练的视觉变换器能否作为有效的零微调特征提取器,用于水果品质评估?
  • RQ2在小规模、真实世界水果图像数据集上,即用型ViT特征的分类准确率与微调CNN相比如何?
  • RQ3ViT模型在显著减少训练样本数量的情况下,能达到多高的准确率,相较于CNN有何优势?
  • RQ4ViT嵌入在真实农业成像中对图像噪声、光照变化和背景杂乱的鲁棒性如何?
  • RQ5DINO学习的ViT特征潜在空间是否能实现比CNN特征更好的线性可分性?

主要发现

  • DINO ViT方法在苹果缺陷检测和香蕉成熟度估计两个数据集上的分类准确率,与最佳性能的微调CNN模型相差不到1%。
  • ViT模型仅需三分之一的训练样本即可达到90%的准确率,展现出卓越的数据效率。
  • DINO ViT嵌入的PCA可视化显示,健康与受损苹果类别的分布存在明显分离,表明其对光照和背景噪声具有鲁棒性。
  • DINO ViT特征的第一主成分的类别分离能力优于ResNet50或VGG-11的主成分,表明其嵌入空间中相关视觉特征的线性化效果更优。
  • 该方法可在标准CPU上实现高性能的水果品质评估,无需GPU支持,显著降低了小型运营商的使用门槛。
  • 结果表明,DINO ViT嵌入具有高度表达性,适用于与表格数据(如传感器或供应链元数据)集成,构建混合建模流程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。