Skip to main content
QUICK REVIEW

[论文解读] gym-DSSAT: a crop model turned into a Reinforcement Learning environment

Romain Gautron, Emilio J. Padrón|arXiv (Cornell University)|Jul 7, 2022
Evolutionary Algorithms and Applications参考文献 51被引用 11
一句话总结

本文介绍了 gym-DSSAT,这是一个开源的强化学习(RL)环境,将高保真的 DSSAT 作物模拟模型集成到 OpenAI Gym 框架中,使 RL 代理能够优化玉米的施肥和灌溉策略。该环境支持可持续实践的发现,初步结果表明,RL 可在保持产量的同时减少资源使用,优于专家策略。

ABSTRACT

Addressing a real world sequential decision problem with Reinforcement Learning (RL) usually starts with the use of a simulated environment that mimics real conditions. We present a novel open source RL environment for realistic crop management tasks. gym-DSSAT is a gym interface to the Decision Support System for Agrotechnology Transfer (DSSAT), a high fidelity crop simulator. DSSAT has been developped over the last 30 years and is widely recognized by agronomists. gym-DSSAT comes with predefined simulations based on real world maize experiments. The environment is as easy to use as any gym environment. We provide performance baselines using basic RL algorithms. We also briefly outline how the monolithic DSSAT simulator written in Fortran has been turned into a Python RL environment. Our methodology is generic and may be applied to similar simulators. We report on very preliminary experimental results which suggest that RL can help researchers to improve sustainability of fertilization and irrigation practices.

研究动机与目标

  • 通过创建一个可用的、开源的 RL 环境用于作物管理,弥合农业模拟与强化学习之间的差距。
  • 使研究人员能够使用广泛信赖的 DSSAT 模型,在基于真实数据的作物管理任务上训练 RL 代理。
  • 证明使用 RL 发现比专家定义策略更可持续的施肥和灌溉实践的可行性。
  • 提供一种通用方法,将单体的、基于 Fortran 的机理模拟器转换为模块化的、基于 Python 的 RL 环境。
  • 通过 Docker 容器和成果物共享确保可复现性,支持跨团队结果验证。

提出的方法

  • 使用 PDI(伪数据接口)库将原始用 Fortran 编写的 DSSAT 作物模拟器封装为基于 Python 的 OpenAI Gym 环境,以处理输入/输出和模拟控制。
  • 该环境暴露了连续的状态空间,包括土壤湿度、养分水平和气象数据,并提供了灌溉和施肥决策的动作空间。
  • 通过真实世界的玉米田间实验初始化模拟,确保训练环境具有生态和农学上的真实性。
  • RL 代理通过马尔可夫决策过程(MDP)与环境交互,接收基于产量、蛋白质含量和资源利用效率的密集奖励。
  • 使用 Stable-Baselines3 的 PPO 算法在预定义的施肥和灌溉情景上评估基线性能。
  • 通过 Docker 容器和成果物共享增强了可复现性,但由于 Fortran 编译中的浮点数差异,跨平台可复现性仍具挑战。

实验结果

研究问题

  • RQ1像 DSSAT 这样高保真的作物模拟器能否被有效转换为可用于农业决策的可用、模块化 RL 环境?
  • RQ2在 gym-DSSAT 中训练的 RL 代理能否发现比专家定义策略更可持续的施肥和灌溉策略?
  • RQ3运行 DSSAT 模拟的计算成本与标准 RL 环境相比如何,是否适合迭代式 RL 训练?
  • RQ4基于 PDI 的接口在多大程度上能确保在不同硬件和软件平台上的可复现性?
  • RQ5用于转换 DSSAT 的方法能否推广到其他用 Fortran、C 或 C++ 编写的机理作物模型?

主要发现

  • gym-DSSAT 有效地将单体的 DSSAT Fortran 模拟器转换为功能完整、开源的基于 Python 的 RL 环境,且与标准 Gym 接口兼容。
  • 该环境支持基于实际玉米田间实验的现实、数据驱动模拟,使代理能够在生态相关的场景中进行训练。
  • 初步实验表明,基础的 PPO RL 代理能够学习到减少氮肥使用但保持或提升产量和蛋白质含量的施肥策略,优于专家策略。
  • 通过 RL 学习的灌溉策略也显示出更高的可持续性,通过减少用水量而不影响产量,表明 RL 在资源优化方面的潜力。
  • 尽管每步模拟时间高于典型 Gym 环境(平均约 1.5 秒),但环境仍保持足够的响应速度以支持典型的 RL 实验。
  • 在相同平台、相同软硬件堆栈下实现了可复现性,但跨平台可复现性受限于 Fortran 编译中的浮点数算术差异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。