Skip to main content
QUICK REVIEW

[論文レビュー] Image Segmentation for Fruit Detection and Yield Estimation in Apple Orchards

Suchet Bargoti, James Underwood|arXiv (Cornell University)|Oct 25, 2016
Smart Agriculture and AI参考文献 39被引用数 5
ひとこと要約

本稿では、単眼UGVが撮影した画像を用いて、りんご畑における果実検出および収量推定のための深層学習ベースの画像セグメンテーションフレームワークを提示する。マルチスケールMLPおよびCNNアーキテクチャに、カメラ位置、太陽の高度角などのメタデータを統合することで、画素単位のセグメンテーションと果実数の正確性が向上し、画像ベースの推定収量と実際の収穫後計量機の計数との間に決定係数 r² = 0.826 の高い相関が得られた。

ABSTRACT

Ground vehicles equipped with monocular vision systems are a valuable source of high resolution image data for precision agriculture applications in orchards. This paper presents an image processing framework for fruit detection and counting using orchard image data. A general purpose image segmentation approach is used, including two feature learning algorithms; multi-scale Multi-Layered Perceptrons (MLP) and Convolutional Neural Networks (CNN). These networks were extended by including contextual information about how the image data was captured (metadata), which correlates with some of the appearance variations and/or class distributions observed in the data. The pixel-wise fruit segmentation output is processed using the Watershed Segmentation (WS) and Circular Hough Transform (CHT) algorithms to detect and count individual fruits. Experiments were conducted in a commercial apple orchard near Melbourne, Australia. The results show an improvement in fruit segmentation performance with the inclusion of metadata on the previously benchmarked MLP network. We extend this work with CNNs, bringing agrovision closer to the state-of-the-art in computer vision, where although metadata had negligible influence, the best pixel-wise F1-score of $0.791$ was achieved. The WS algorithm produced the best apple detection and counting results, with a detection F1-score of $0.858$. As a final step, image fruit counts were accumulated over multiple rows at the orchard and compared against the post-harvest fruit counts that were obtained from a grading and counting machine. The count estimates using CNN and WS resulted in the best performance for this dataset, with a squared correlation coefficient of $r^2=0.826$.

研究の動機と目的

  • 地上ベースの単眼ビジョンを用いて、商業用りんご畑における果実検出および収量推定のための自動画像処理パイプラインを開発すること。
  • エンドツーエンドの画像セグメンテーションを実現するため、一般化された深層学習モデル(ms-MLPおよびCNN)を用いて、手作業で設計された特徴量に依存することを減らすこと。
  • カメラの軌道や太陽の位置といった文脈的メタデータを学習プロセスに組み込むことで、セグメンテーションおよび検出性能を向上させること。
  • 収穫後のグレーディングマシンによる実際の計数と比較して、フレームワークの正確性を評価し、信頼性の高い収量マッピングを可能にすること。

提案手法

  • りんご畑のシーンにおける果実の画素単位の画像セグメンテーションに、マルチスケールの多重層パーセプトロン(ms-MLP)および畳み込みニューラルネットワーク(CNN)を採用した。
  • ms-MLPおよびCNNモデルの入力特徴に、ピクセル位置、ロウ番号、カメラからの太陽位置などのメタデータを統合し、外観の変動をモデル化した。
  • セグメンテーション出力をウォーターシェドセグメンテーション(WS)および円形ハフ変換(CHT)を用いて後処理し、個々の果実の検出と計数を実施した。
  • 画像ベースの果実数を収穫後のグレーディングマシンによる実際の計数と照合することで、収量推定の正確性を評価した。
  • 自然光下で撮影された0.5ヘクタールのりんご畑データセットを用いてモデルを学習した。このデータセットには、赤、ピンクグリーン、緑色の多様な品種が含まれており、照明条件や隠蔽状態の多様性も含まれる。
  • トランスファー学習の原則に従い、事前学習済みCNNを用いることで、メタデータに依存しない状態で最先端のセグメンテーション性能を達成した。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルにメタデータを統合することで、現実の畑画像における果実の画素単位のセグメンテーション性能が向上するか?
  • RQ2メタデータの統合が、ms-MLPとCNNアーキテクチャの両方における果実セグメンテーションタスクの性能に与える影響は何か?
  • RQ3ウォーターシェッドセグメンテーション(WS)と円形ハフ変換(CHT)のうち、どちらの後処理アルゴリズムがより正確な個々の果実の検出と計数を実現するか?
  • RQ4画像ベースの果実数と実際の収穫後計数との相関はどの程度高く達成可能か?また、本フレームワークを用いた収量推定の正確性はどの程度か?

主な発見

  • メタデータの統合により、ms-MLPネットワークにおけるセグメンテーション性能が向上し、メタデータが少ない学習例でも単純なモデルがより良い一般化性能を示すことが実証された。
  • CNNモデルは、メタデータの影響がほとんどないにもかかわらず、画素単位のセグメンテーションF1スコアで最高の0.791を達成した。これは、CNNがメタデータの支援なしに、複雑な視覚的パターンを内蔵で捉えられることを示している。
  • ウォーターシェッドセグメンテーション(WS)は円形ハフ変換(CHT)を上回り、果実検出のF1スコアが0.858を記録した。
  • CNNベースのセグメンテーションとWSベースの検出を組み合わせたアプローチが、最も優れた収量推定性能を示し、画像ベースの計数と実際の収穫後計数との間に決定係数 r² = 0.826 の高い相関が得られた。
  • 1枚の1232×1616画像あたりの予測時間は約7秒であり、ロボットプラットフォームへのリアルタイム導入の可能性を示している。
  • 本フレームワークは、標準的なUGV撮影を除いて追加のデータ収集を要せず、非破壊的かつスケーラブルな収量マッピングを実現できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。