Skip to main content
QUICK REVIEW

[論文レビュー] Robust Fruit Counting: Combining Deep Learning, Tracking, and Structure from Motion

Xu Liu, Steven W. Chen|arXiv (Cornell University)|Apr 1, 2018
Smart Agriculture and AI被引用数 12
ひとこと要約

本論文では、深層学習に基づくセグメンテーション、カルマンフィルタで補正されたKLTトラッカーを用いたフレーム間トラッキング、およびSfMによる3次元局所化を組み合わせた新規な果実数え上げパイプラインを提示する。この手法は、遮蔽や照明変動に起因する過剰カウントを顕著に低減し、オレンジとリンゴのデータセットでそれぞれL1誤差203および3.3%の平均誤差を達成し、構造のない環境下でも著しく高い耐性を示す。

ABSTRACT

We present a novel fruit counting pipeline that combines deep segmentation, frame to frame tracking, and 3D localization to accurately count visible fruits across a sequence of images. Our pipeline works on image streams from a monocular camera, both in natural light, as well as with controlled illumination at night. We first train a Fully Convolutional Network (FCN) and segment video frame images into fruit and non-fruit pixels. We then track fruits across frames using the Hungarian Algorithm where the objective cost is determined from a Kalman Filter corrected Kanade-Lucas-Tomasi (KLT) Tracker. In order to correct the estimated count from tracking process, we combine tracking results with a Structure from Motion (SfM) algorithm to calculate relative 3D locations and size estimates to reject outliers and double counted fruit tracks. We evaluate our algorithm by comparing with ground-truth human-annotated visual counts. Our results demonstrate that our pipeline is able to accurately and reliably count fruits across image sequences, and the correction step can significantly improve the counting accuracy and robustness. Although discussed in the context of fruit counting, our work can extend to detection, tracking, and counting of a variety of other stationary features of interest such as leaf-spots, wilt, and blossom.

研究の動機と目的

  • 変動する照明、遮蔽、奥行きの変動を伴う構造のない果樹園環境における正確な果実数え上げの課題に対処すること。
  • 深層学習と3次元再構成を用いて、単一画像の果実検出を動画シーケンスに拡張する耐性のあるパイプラインを開発すること。
  • 3次元局所化とサイズ推定を用いて、トラッキング誤差に起因する過剰カウントと誤検出を低減すること。
  • 自然光と複雑な木構造を有する実世界のデータセットを用いて、手法の評価を行うこと。
  • 単眼カメラデータのみを用いて、低リソースの農業環境への実用的導入を可能とすること。

提案手法

  • 人為アノテーションによる正例データを用いて、完全畳み込みネットワーク(FCN)を訓練し、各画像フレームを果実ピクセルと非果実ピクセルにセグメンテーションする。
  • カルマンフィルタで補正されたKLTトラッカーから得られるコスト関数を目的関数として用い、ハンガリアン法を用いてフレーム間の果実トラッキングを実行する。
  • 検出された果実領域付近のSIFT特徴点を対象として、SfMを適用し、果実の3次元位置と相対的なサイズを推定する。
  • 3次元局所化とサイズ推定結果を用いて、外れ値トラックを除外し、最終的なカウントにおける二重カウントされた果実を是正する。
  • 補正ステップでは、空間的一致性とサイズ分布を活用してトラッキングの信頼性を向上させる。
  • パイプラインは2つのデータセットで評価された:高遮蔽と奥行き変動を伴う自然光下のオレンジ、および制御された夜間照明下のリンゴ。

実験結果

リサーチクエスチョン

  • RQ1深層学習に基づくセグメンテーションモデルは、複雑で構造のない果樹園環境における果実検出の正確性を向上させ得るか?
  • RQ2カルマンフィルタで補正されたKLTトラッキングとハンガリアン割り当てを組み合わせたトラッキング・バイ・検出手法は、画像シーケンス全体でトラッキング誤差をどれほど低減できるか?
  • RQ3SfMによる3次元局所化は、誤検出の除外と二重カウントトラックの是正を通じて、果実数え上げの正確性をどの程度向上させるか?
  • RQ4自然光や高遮蔽を伴う環境変動下でも、補正ステップはどの程度の性能を示すか?
  • RQ5本パイプラインは異なる果実種別に一般化可能であり、単眼カメラデータのみを用いた低リソース農業環境への導入が可能か?

主な発見

  • 高遮蔽、奥行き変動、自然光を伴うオレンジデータセットでは、L1誤差203、平均誤差-0.2%を達成した。
  • リンゴデータセットでは、補正前のモデルがL1誤差673、平均誤差8.5%であったが、補正後は322および3.3%に低下した。
  • リンゴデータセットでは、誤差の標準偏差が4.7%から4.1%に低下し、一貫性の向上が示された。
  • 補正ステップは、環境変動が著しいオレンジデータセットに対してより顕著な効果を示し、構造のない環境下での耐性を裏付けた。
  • 3次元局所化とサイズ推定ステップにより、外れ値の除外と二重カウントトラックの是正が顕著に正確性を向上させた。
  • 本手法は、高遮蔽・自然光条件(オレンジ)および高色類似性・制御光条件(リンゴ)の両方で有効であり、広範な適用可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。