Skip to main content
QUICK REVIEW

[論文レビュー] Integrating processed-based models and machine learning for crop yield prediction

Michiel Kallenberg, Bernardo Maestrini|arXiv (Cornell University)|Jul 25, 2023
Smart Agriculture and AI被引用数 6
ひとこと要約

本稿では、プロセスベースの作物モデル(Tipstar)によって生成された合成データ上で事前学習を行い、実世界のジャガイモ収量データで微調整するメタモデリング手法を提案する。この手法は、データが乏しい状況下でも予測精度を向上させ、シミュレーション上では完全にデータ駆動型のモデルを上回り、実現地データではプロセスモデルと同等の結果を示すが、商業的畝においては単純なエキスパート設計の線形モデルがすべてを上回った。これは、データが限られ、モデルの複雑さが高いためである。

ABSTRACT

Crop yield prediction typically involves the utilization of either theory-driven process-based crop growth models, which have proven to be difficult to calibrate for local conditions, or data-driven machine learning methods, which are known to require large datasets. In this work we investigate potato yield prediction using a hybrid meta-modeling approach. A crop growth model is employed to generate synthetic data for (pre)training a convolutional neural net, which is then fine-tuned with observational data. When applied in silico, our meta-modeling approach yields better predictions than a baseline comprising a purely data-driven approach. When tested on real-world data from field trials (n=303) and commercial fields (n=77), the meta-modeling approach yields competitive results with respect to the crop growth model. In the latter set, however, both models perform worse than a simple linear regression with a hand-picked feature set and dedicated preprocessing designed by domain experts. Our findings indicate the potential of meta-modeling for accurate crop yield prediction; however, further advancements and validation using extensive real-world datasets is recommended to solidify its practical effectiveness.

研究の動機と目的

  • 農業分野における完全にデータ駆動型の機械学習モデルが、実世界の状況ではしばしば入手困難な大規模かつ多様なデータセットを必要とすることの制限を克服すること。
  • パラメータの感度とシステムの複雑さのため、局所的な条件に適合させるためにプロセスベースの作物モデルをキャリブレーションすることが難しいという課題を克服すること。
  • プロセスベースのモデルから得た合成データで深層学習モデルを事前学習することで、実世界のデータに対する収量予測性能が向上するかどうかを評価すること。
  • 実世界のジャガイモ収量データセットにおいて、ハイブリッドメタモデリング手法の性能を、単独のプロセスベースモデル、完全にデータ駆動型のモデル、およびドメインエキスパートが設計した線形モデルと比較すること。

提案手法

  • 7地点、32年、32種の土壌タイプ、および窒素施肥、播種日、灌漑、根の深さ、品種の早期成熟性のランダム入力を含む全要因の組み合わせにより、86,000件の合成データセットが生成された。
  • 時間的気象データ(日射量、降水量、気温、灌漑、窒素投入量)のストリームとスカラー入力(播種日、根の深さ、品種の早期成熟性)のストリームを別々に処理する、マルチストリーム1次元畳み込みニューラルネットワークが、この合成データ上で学習された。
  • 局所的な条件に適応させるために、303件のフィールド試験と77件の商業的畝からの実世界観測データを用いて、事前学習済みモデルが微調整された。
  • 性能は、単独のTipstarプロセスベースモデル、事前学習なしの完全にデータ駆動型モデル、エキスパートが選択した特徴量と前処理を施した手作業の線形回帰モデルと比較された。
  • メタモデルは、データが乏しい環境における表現学習をガイドするため、プロセスベースモデルの出力を事前知識として活用するトランスファー学習を採用している。
Figure 1: Schematic overview of experimental setup, data flow and model development
Figure 1: Schematic overview of experimental setup, data flow and model development

実験結果

リサーチクエスチョン

  • RQ1プロセスベースの作物モデルから得た合成データで深層ニューラルネットワークを事前学習することで、実世界データにおける収量予測精度が向上するか?
  • RQ2実世界のジャガイモ収量予測において、メタモデルの性能は単独のプロセスベースモデルや完全にデータ駆動型のモデルと比べてどうか?
  • RQ3データが限られ、コントラストが低い状況下で、合成データの導入が、複雑なモデルの過学習リスクを軽減するか?
  • RQ4データが乏しい農業的状況下において、ハイブリッドメタモデリング手法は、従来のデータ駆動型モデルやエキスパート設計の線形モデルを上回るか?

主な発見

  • シミュレーション上、メタモデルは完全にデータ駆動型のモデルを上回り、微調整後にわずか50件の実世界データポイントで同等の性能を達成したのに対し、データ駆動型ベースラインは1,000ポイントを必要としていた。
  • フィールド試験データセット(n=303)では、メタモデルはR²=0.60を達成し、完全にデータ駆動型モデル(R²=0.02)を上回り、プロセスベースモデル(R²=0.70)と同等の性能を示した。
  • 商業的畝データセット(n=77)では、メタモデルはR²=0.39を達成し、プロセスベースモデル(R²=0.63)よりは低かったが、依然として競争力のある結果であった。
  • エキスパートが設計した線形回帰モデルは、商業的畝データセットで最も優れた性能を示し、R²=0.72、RMSE=9.75を達成した。これは、シンプルなモデルがデータが少ないが高標準化された環境ではより頑健である可能性を示唆している。
  • 完全にデータ駆動型モデルは、実世界データでは性能が低く(試験ではR²=0.02、RMSE=15.80)、モデルの複雑さとデータの多様性の欠如のため、小規模でコントラストが低いデータセットでの過学習のリスクが顕著に現れた。
  • プロセスベースモデルから得た合成データによる事前学習は、一般化性能の向上と大規模な実世界データセットへの依存度低減に効果的であり、特にデータが乏しい農業的文脈において顕著であった。
Figure 2: Fitness of the metamodel on the (hold-out) synthetic dataset (n=13,000; RMSE=5.1, black
Figure 2: Fitness of the metamodel on the (hold-out) synthetic dataset (n=13,000; RMSE=5.1, black

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。