Skip to main content
QUICK REVIEW

[论文解读] Integrating processed-based models and machine learning for crop yield prediction

Michiel Kallenberg, Bernardo Maestrini|arXiv (Cornell University)|Jul 25, 2023
Smart Agriculture and AI被引用 6
一句话总结

本文提出了一种元建模方法,即在基于过程的作物模型(Tipstar)生成的合成数据上预训练卷积神经网络,并在真实世界马铃薯产量数据上进行微调。该方法在数据稀缺环境下提升了预测准确性,在模拟中优于纯数据驱动模型,在真实田间数据上与过程模型表现相当,尽管在商业田地中,简单的专家设计线性模型表现更优,原因在于数据有限且模型复杂度较高。

ABSTRACT

Crop yield prediction typically involves the utilization of either theory-driven process-based crop growth models, which have proven to be difficult to calibrate for local conditions, or data-driven machine learning methods, which are known to require large datasets. In this work we investigate potato yield prediction using a hybrid meta-modeling approach. A crop growth model is employed to generate synthetic data for (pre)training a convolutional neural net, which is then fine-tuned with observational data. When applied in silico, our meta-modeling approach yields better predictions than a baseline comprising a purely data-driven approach. When tested on real-world data from field trials (n=303) and commercial fields (n=77), the meta-modeling approach yields competitive results with respect to the crop growth model. In the latter set, however, both models perform worse than a simple linear regression with a hand-picked feature set and dedicated preprocessing designed by domain experts. Our findings indicate the potential of meta-modeling for accurate crop yield prediction; however, further advancements and validation using extensive real-world datasets is recommended to solidify its practical effectiveness.

研究动机与目标

  • 为解决纯数据驱动的机器学习模型在农业中面临的局限性,这些模型通常需要大量且多样的数据集,而这些数据在真实世界环境中往往难以获取。
  • 克服由于参数敏感性和系统复杂性,导致基于过程的作物模型难以针对本地条件进行校准的挑战。
  • 评估在基于过程的模型生成的合成数据上预训练深度学习模型,是否能提升在真实世界数据上的产量预测性能。
  • 在真实世界马铃薯产量数据集上,比较该混合元建模方法与独立的基于过程的模型、纯数据驱动模型以及领域专家设计的线性模型的性能。

提出的方法

  • 通过7个地点、32年、32种土壤类型以及氮肥施用、播种日期、灌溉、根系深度和品种早熟性等参数的全因子组合,生成了包含86,000个样本的合成数据集。
  • 使用多流一维卷积神经网络在该合成数据上进行训练,其中时间序列气象数据(太阳辐射、降雨量、温度、灌溉、氮输入)和标量输入(播种日期、根系深度、品种早熟性)分别通过独立的流处理。
  • 利用来自303个田间试验和77个商业田地的真实观测数据对预训练模型进行微调,以适应本地条件。
  • 将性能与独立的Tipstar基于过程的模型、无预训练的纯数据驱动模型,以及专家手工选择特征和预处理的线性回归模型进行比较。
  • 该元模型通过利用基于过程的模型输出作为先验知识,引导在数据稀缺环境下的表征学习,实现迁移学习。
Figure 1: Schematic overview of experimental setup, data flow and model development
Figure 1: Schematic overview of experimental setup, data flow and model development

实验结果

研究问题

  • RQ1在基于过程的作物模型生成的合成数据上预训练深度神经网络,是否能提升在真实世界数据上的产量预测准确性?
  • RQ2在真实世界马铃薯产量预测中,元模型的性能与独立的基于过程的模型和纯数据驱动模型相比如何?
  • RQ3在训练数据有限且对比度低的情况下,引入合成数据是否能降低复杂模型的过拟合风险?
  • RQ4在数据稀缺的农业环境中,混合元建模方法是否优于传统数据驱动模型和专家设计的线性模型?

主要发现

  • 在仿真环境中,元模型优于纯数据驱动模型,仅用50个真实世界数据点微调后即达到与数据驱动基线模型使用1,000个数据点相当的性能。
  • 在田间试验数据集(n=303)上,元模型的R²为0.60,优于纯数据驱动模型(R²=0.02),并与基于过程的模型(R²=0.70)表现相当。
  • 在商业田地数据集(n=77)上,元模型的R²为0.39,低于基于过程的模型(R²=0.63),但仍具竞争力。
  • 专家设计的线性回归模型在商业田地数据集中表现最优,R²为0.72,RMSE为9.75,表明在低数据、高标准化环境下,更简单的模型可能更具鲁棒性。
  • 纯数据驱动模型在真实世界数据上表现较差(试验中R²=0.02,RMSE=15.80),可能由于模型复杂度高且缺乏数据多样性,凸显了在小样本、低对比度数据集中过拟合的风险。
  • 使用基于过程的模型生成的合成数据进行预训练,有效提升了泛化能力并减少了对大规模真实世界数据集的依赖,尤其在数据匮乏的农业环境中效果显著。
Figure 2: Fitness of the metamodel on the (hold-out) synthetic dataset (n=13,000; RMSE=5.1, black
Figure 2: Fitness of the metamodel on the (hold-out) synthetic dataset (n=13,000; RMSE=5.1, black

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。