Skip to main content
QUICK REVIEW

[論文レビュー] YOLOv5s-BC: An improved YOLOv5s-based method for real-time apple detection

Jingfan Liu, Zhaobing Liu|arXiv (Cornell University)|Nov 10, 2023
Smart Agriculture and AI被引用数 4
ひとこと要約

本稿では、バックボーンに座標注意ブロックを統合し、特徴マップの融合に双方向特徴ピラミッドネットワーク(BiFPN)を採用し、小・遠方のりんごをより効果的に検出できるように改造したYOLOv5sベースの拡張モデル、YOLOv5s-BCを提案する。このモデルはYOLOv5sよりmAPで4.6%向上を達成し、1枚あたり0.018秒のリアルタイム推論を実現するとともに、モデルサイズは16.7 Mbに収束している。

ABSTRACT

To address the issues associated with the existing algorithms for the current apple detection, this study proposes an improved YOLOv5s-based method, named YOLOv5s-BC, for real-time apple detection, in which a series of modifications have been introduced. Firstly, a coordinate attention (CA) block has been incorporated into the backbone module to construct a new backbone network. Secondly, the original concatenation operation has been replaced with a bidirectional feature pyramid network (BiFPN) in the neck module. Lastly, a new detection head has been added to the head module, enabling the detection of smaller and more distant targets within the field of view of the robot. The proposed YOLOv5s-BC model was compared to several target detection algorithms, including YOLOv5s, YOLOv4, YOLOv3, SSD, Faster R-CNN (ResNet50), and Faster R-CNN (VGG), with significant improvements of 4.6%, 3.6%, 20.48%, 23.22%, 15.27%, and 15.59% in mAP, respectively. The detection accuracy of the proposed model is also greatly enhanced over the original YOLOv5s model. The model boasts an average detection speed of 0.018 seconds per image, and the weight size is only 16.7 Mb with 4.7 Mb smaller than that of YOLOv8s, meeting the real-time requirements for the picking robot. Furthermore, according to the heat map, our proposed model can focus more on and learn the high-level features of the target apples, and recognize the smaller target apples better than the original YOLOv5s model. Then, in other apple orchard tests, the model can detect the pickable apples in real time and correctly, illustrating a decent generalization ability.

研究の動機と目的

  • 現実の果樹園環境において、小・遠方のりんごを検出する際の従来のYOLOベースモデルの限界を解消すること。
  • ロボット摘果用途に適したリアルタイム推論速度を維持しつつ、小サイズのターゲットに対する検出精度を向上させること。
  • 複雑な果樹園シーンにおける汎化性能を向上させるために、ネットワークアーキテクチャにおける特徴表現と特徴融合を強化すること。
  • 性能を損なわずにモデルサイズを縮小し、リソース制限のあるロボットシステムへのデプロイを可能にすること。

提案手法

  • ターゲットオブジェクトの空間的座標に注目することで特徴学習を強化するため、YOLOv5sのバックボーンに座標注意(CA)ブロックを統合した。
  • ネック部の元の特徴マップ融合処理を、双方向特徴ピラミッドネットワーク(BiFPN)に置き換えることで、マルチスケール特徴の集約を改善した。
  • 受容 field を拡大し、特徴の感度を向上させることで、小・遠方のりんごの局所化と分類をより効果的に行えるように、新たな検出ヘッドを設計した。
  • リアルタイム推論を最適化し、低遅延かつエッジデバイスに適したコンactなモデルサイズを実現するため、全体のネットワークアーキテクチャを最適化した。
  • 注目メカニズムと特徴ピラムドの最適化を組み合わせることで、明るさの変動や隠蔽状態が激しい状況下でも検出のロバスト性を向上させた。

実験結果

リサーチクエスチョン

  • RQ1YOLOv5sに座標注意を統合することで、果樹園環境下での小・遠方りんごの検出精度が向上するか?
  • RQ2元の特徴融合処理をBiFPNに置き換えることで、マルチスケール特徴表現と検出性能が向上するか?
  • RQ3再設計された検出ヘッドは、元のYOLOv5sヘッドと比較して、小サイズターゲットの局所化にどの程度寄与するか?
  • RQ4YOLOv4、YOLOv3、SSD、Faster R-CNNの変種といった最先端の検出器と比較して、YOLOv5s-BCのmAPと推論速度はどのように差がつくか?
  • RQ5提案されたモデルは、より高い精度とより小さなモデルサイズを達成しながらも、リアルタイム推論速度を維持できるか?

主な発見

  • YOLOv5s-BCは、りんご検出ベンチマークにおいて、元のYOLOv5sモデルと比較してmAPで4.6%の絶対的向上を達成した。
  • YOLOv4に対して3.6%、YOLOv3に対して20.48%、SSDに対して23.22%、Faster R-CNN(ResNet50)に対して15.27%、Faster R-CNN(VGG)に対して15.59%のmAP向上を示した。
  • 1枚あたりの平均推論速度は0.018秒であり、ロボット摘果システムのリアルタイム要件を満たしている。
  • モデルサイズは16.7 Mbにまで縮小され、YOLOv8sより4.7 Mb小さいため、エッジデバイスへのデプロイ性が向上した。
  • ヒートマップ可視化の結果、YOLOv5s-BCは元のYOLOv5sと比較して、特に小・遠方のりんごに対して高レベルの特徴に注目していることが確認された。
  • 実際の果樹園環境での現地テストにより、モデルが正確かつリアルタイムで収穫可能なりんごを検出できることを確認し、優れた汎化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。