[論文レビュー] Presenting an extensive lab- and field-image dataset of crops and weeds for computer vision tasks in agriculture
本論文は、120万枚以上のラボで育てた植物および54万枚以上の現地で育てた植物の画像からなる2つの大規模で公開可能なデータセットを提示する。これらのデータセットは、種別、植物の成長日数、生育段階、環境条件などのメタデータを含んでおり、農業分野におけるコンピュータビジョンの研究を支援する。1万4000枚のオープンアクセスサブセットにより、種分類や雑草と作物の区別に関するモデルの素早いプロトタイピングが可能となる。
We present two large datasets of labelled plant-images that are suited towards the training of machine learning and computer vision models. The first dataset encompasses as the day of writing over 1.2 million images of indoor-grown crops and weeds common to the Canadian Prairies and many US states. The second dataset consists of over 540,000 images of plants imaged in farmland. All indoor plant images are labelled by species and we provide rich etadata on the level of individual images. This comprehensive database allows to filter the datasets under user-defined specifications such as for example the crop-type or the age of the plant. Furthermore, the indoor dataset contains images of plants taken from a wide variety of angles, including profile shots, top-down shots, and angled perspectives. The images taken from plants in fields are all from a top-down perspective and contain usually multiple plants per image. For these images metadata is also available. In this paper we describe both datasets' characteristics with respect to plant variety, plant age, and number of images. We further introduce an open-access sample of the indoor-dataset that contains 1,000 images of each species covered in our dataset. These, in total 14,000 images, had been selected, such that they form a representative sample with respect to plant age and ndividual plants per species. This sample serves as a quick entry point for new users to the dataset, allowing them to explore the data on a small scale and find the parameters of data most useful for their application without having to deal with hundreds of thousands of individual images.
研究の動機と目的
- 機械学習モデルのトレーニングに必要な大規模で高品質なラベル付き植物画像データの不足という、デジタル農業における重要なボトル neck を解決すること。
- カナダ・プレリーズおよび米国北部諸州に一般的に見られる作物および雑草の包括的でメタデータ豊富なデータセットを提供し、精密農業研究を支援すること。
- 実際の多様な植物の外観を反映した、種分類、雑草検出、植物形態計測のためのコンピュータビジョンモデルのトレーニングおよび評価を可能にすること。
- ラボおよび雑草の成長日数と種の分布を保ったまま、研究者が素早くモデルを検証できるように、キュレートされた1万4000枚の画像サブセットを提供すること。
- データ共有のベストプラクティスに従い、データシートを添付してオープンアクセスでリリースすることで、長期的なデータの利用可能性と再現可能性を確保すること。
提案手法
- 制御されたラボ環境下でロボットシステムを用いた自動画像収集により、一貫した照明条件下で複数の角度(上部、側面、斜め)から植物を撮影する。
- トレイクターに搭載されたステレオカメラを用いて現地の画像を収集し、地上からの上部視点で動画を記録。フレーム抽出により、現地データサブセットを構築する。
- 自動検出アルゴリズムを用いて、画像内の個々の植物を囲むバウンディングボックスを生成し、全フレームからの個々の植物を切り出した画像の作成を可能にする。
- ラボデータから1種類あたり1000枚の画像を、植物の成長日数と個体の多様性に比例するように、層別抽出戦略を用いて選択する。
- 植物の種類、成長日数(日数)、生育段階、環境条件(例:温度、湿度、カメラ高さ)などのメタデータ収集。
- CyVerseおよびEMILIデータポータルを通じた段階的リリースによるデータ管理。全データセットおよびサブセットはオープンアクセスライセンスで公開され、透明性を高めるためにデータシートが付随する。
実験結果
リサーチクエスチョン
- RQ1大規模で多様性に富み、正確にアノテートされた植物画像データセットを、農業分野におけるコンピュータビジョンを支援する形で、体系的に収集・構造化する方法は何か?
- RQ2120万枚を超える全データセットのうち、1万4000枚の代表的サブセットが、成長日数と種の分布をどの程度正確に保持しているか?
- RQ3ラボおよび現地で育てた植物画像の主な特徴として、種の多様性、画像枚数、メタデータの豊富さの観点から、それぞれどのような特徴があるか?
- RQ4オープンアクセスによるデータ共有とメタデータの標準化は、デジタル農業分野の研究における再現性とイノベーションをどのように向上させるか?
- RQ5キュレートされた小規模なサブセットは、農業アプリケーションにおける植物画像データセットに初めて取り組む研究者にとって、実際の利点は何か?
主な発見
- ラボデータには、室内で育てた14種の作物および雑草の120万枚以上の画像が含まれており、複数の角度から撮影され、植物の成長日数および個体識別情報などのメタデータが付加されている。
- 現地データは、2019年および2020年の生育期間中に収集された54万枚の地上からの上部視点の画像から構成されており、天候およびカメラ高さなどの追加メタデータが含まれる。
- 1万4000枚のサブセットは、全ラボデータの成長日数分布および個体の代表的表現を保持しており、1種類あたり1000枚の画像を、バランスの取れたカバレッジが得られるように選択している。
- このサブセットは、DOI 10.25739/rwcw-ex45 を介して CyVerse Data Store で公開されており、モデルのトレーニングおよび評価に即座にアクセス可能である。
- 全データセットは、EMILIデータポータル(http://emilicanada.com/)のデジタル農業アセットマップにホスティングされており、継続的なデータ収集が行われ、3次元点群や高スペクトル画像への拡張が予定されている。
- データセットはデータシートとともにリリースされており、データ共有のベストプラクティスに従っており、デジタル農業分野の研究における透明性、再現性、利用可能性の向上に寄与している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。