[论文解读] DeepApple: Deep Learning-based Apple Detection using a Suppression Mask R-CNN
本文提出 DeepApple,一种用于复杂果园环境中鲁棒苹果检测的抑制 Mask R-CNN 框架。通过在主干网络中引入一个抑制分支以过滤非苹果特征,该方法在标准台式机上实现了 0.905 的 SOTA F1 分数和每帧 0.25 秒的检测时间,显著提升了在光照变化和遮挡条件下现有模型的准确性。
Robotic apple harvesting has received much research attention in the past few years due to growing shortage and rising cost in labor. One key enabling technology towards automated harvesting is accurate and robust apple detection, which poses great challenges as a result of the complex orchard environment that involves varying lighting conditions and foliage/branch occlusions. This letter reports on the development of a novel deep learning-based apple detection framework named DeepApple. Specifically, we first collect a comprehensive apple orchard dataset for 'Gala' and 'Blondee' apples, using a color camera, under different lighting conditions (sunny vs. overcast and front lighting vs. back lighting). We then develop a novel suppression Mask R-CNN for apple detection, in which a suppression branch is added to the standard Mask R-CNN to suppress non-apple features generated by the original network. Comprehensive evaluations are performed, which show that the developed suppression Mask R-CNN network outperforms state-of-the-art models with a higher F1-score of 0.905 and a detection time of 0.25 second per frame on a standard desktop computer.
研究动机与目标
- 解决在光照变化和遮挡条件下真实果园环境中准确且鲁棒的苹果检测挑战。
- 开发一种基于深度学习的检测框架,以减少由叶片和枝条引起的误报。
- 在多样化的光照和环境条件下,收集并处理 'Gala' 和 'Blondee' 苹果的综合数据集。
- 通过引入一个可过滤非苹果特征的抑制分支,改进现有的 Mask R-CNN 模型。
- 在机器人采摘应用中实现苹果检测的 SOTA 性能。
提出的方法
- 通过在标准 Mask R-CNN 中增加一个抑制分支,开发了一种新颖的抑制 Mask R-CNN 架构,该分支可从特征图中过滤掉非苹果特征。
- 抑制分支通过两个置信度阈值运行:分类分支中的 $th_1$ 和特征抑制头中的 $th_2$,从而实现对误报抑制的动态控制。
- 该网络在包含 13,905 张图像的自定义数据集上进行端到端训练,数据来自两个果园,涵盖 'Gala' 和 'Blondee' 苹果在晴天、多云、正面和背面光照条件下的图像。
- 通过帕累托前沿分析对 $th_1$ 和 $th_2$ 进行调优,以在精确率和召回率之间实现最佳平衡。
- 主干网络采用 ResNet-50,模型使用标准指标(精确率、召回率和 F1 分数)进行评估。
- 消融研究将抑制 Mask R-CNN 与使用 ResNet-50、ResNet-101 和 ResNet-152 主干的普通 Mask R-CNN 进行了对比。
实验结果
研究问题
- RQ1Mask R-CNN 中的抑制分支能否有效减少因遮挡和非果实结构在果园场景中引起的误报检测?
- RQ2在真实光照和遮挡条件下,与 SOTA 模型相比,所提出的抑制 Mask R-CNN 在 F1 分数和推理速度方面表现如何?
- RQ3集成抑制机制是否能提升在不同苹果品种和光照条件下的检测鲁棒性?
- RQ4在调优抑制阈值 $th_1$ 和 $th_2$ 时,精确率与召回率之间的最优权衡是什么?
- RQ5该抑制机制是否能在参数量更少的情况下,优于如 ResNet-152 这类更深的主干网络?
主要发现
- 抑制 Mask R-CNN 实现了 0.905 的 F1 分数,优于所有基线模型,包括使用更深 ResNet 主干的模型。
- 该模型在标准台式机上实现了每帧 0.25 秒的检测时间,证明了其具备实时可行性。
- 在最优配置 $C_1$ 下,与基线 Mask R-CNN 相比,该模型的精确率提高了 10%,召回率提高了 0.4%。
- 配置 $C_2$ 实现了 0.939 的召回率,显著降低了误检率,同时保持了高精确率。
- 该模型在 'Blondee' 苹果上的表现优于 'Gala' 苹果,表明可能存在品种相关的检测敏感性差异。
- 在多云或直射光照条件下,检测性能高于背光条件,表明人工光源可能进一步提升结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。