Skip to main content
QUICK REVIEW

[论文解读] Optimal Sequential Decision-Making in Geosteering: A Reinforcement Learning Approach

Ressi Bonti Muhammad, Sergey Alyaev|arXiv (Cornell University)|Oct 7, 2023
Oil and Gas Production Techniques被引用 4
一句话总结

本文提出一种基于深度Q网络(DQN)的无模型强化学习(RL)方法,用于实时优化顺序地质导向决策,无需显式环境模型。该方法在推理时间上实现显著降低,评估1,000个储层实例的时间不足10秒,而近似动态规划(ADP)方法需4–5小时,性能与ADP相当,展现出计算效率和在复杂、不确定地质导向环境中的适应能力。

ABSTRACT

Trajectory adjustment decisions throughout the drilling process, called geosteering, affect subsequent choices and information gathering, thus resulting in a coupled sequential decision problem. Previous works on applying decision optimization methods in geosteering rely on greedy optimization or approximate dynamic programming (ADP). Either decision optimization method requires explicit uncertainty and objective function models, making developing decision optimization methods for complex and realistic geosteering environments challenging to impossible. We use the Deep Q-Network (DQN) method, a model-free reinforcement learning (RL) method that learns directly from the decision environment, to optimize geosteering decisions. The expensive computations for RL are handled during the offline training stage. Evaluating DQN needed for real-time decision support takes milliseconds and is faster than the traditional alternatives. Moreover, for two previously published synthetic geosteering scenarios, our results show that RL achieves high-quality outcomes comparable to the quasi-optimal ADP. Yet, the model-free nature of RL means that by replacing the training environment, we can extend it to problems where the solution to ADP is prohibitively expensive to compute. This flexibility will allow applying it to more complex environments and make hybrid versions trained with real data in the future.

研究动机与目标

  • 解决地质导向中顺序决策的挑战,其中轨迹调整依赖于动态的随钻测井(LWD)数据和不确定的地下条件。
  • 克服现有方法(如贪心优化和近似动态规划,ADP)的局限性,这些方法需要显式环境模型,在复杂场景下变得不可行。
  • 开发一种灵活且计算高效的地质导向决策支持系统,采用无模型强化学习,直接从环境交互中学习。
  • 证明RL可实现接近最优的结果,与ADP性能相当,同时将评估时间从数小时缩短至数秒。
  • 通过更换训练环境而无需重新训练整个策略,实现向更复杂或此前难以处理的地质导向问题的扩展。

提出的方法

  • 采用深度Q网络(DQN),一种无模型强化学习算法,直接从模拟钻井环境中学习最优地质导向策略。
  • 使用传感器输入和地质参数(如储层边界、井眼位置、倾角)定义状态空间,其中一种变体(RL-Sensor)不包含显式后验更新,以减少计算开销。
  • 采用基于预期油气产量和接近储层目标程度的奖励函数,鼓励做出最大化长期价值的轨迹决策。
  • 使用经验回放和目标网络在离线状态下训练DQN智能体,以稳定学习过程,并对奖励进行调整以反映地质导向目标。
  • 通过使用原始传感器输入作为状态特征,将贝叶斯模型更新步骤与状态表示解耦,相比完整后验建模显著降低计算开销。
  • 在实时推理模式下评估训练好的智能体,实现毫秒级推理时间,适用于实际部署。

实验结果

研究问题

  • RQ1在无显式环境模型的前提下,无模型强化学习方法是否能在合成地质导向场景中实现与近似最优ADP相当的性能?
  • RQ2在评估多个储层实例时,RL的计算效率与传统基于ADP的方法相比如何?
  • RQ3在状态表示中省略贝叶斯后验更新(即RL-Sensor与RL-Posterior对比)对性能和推理速度有何影响?
  • RQ4RL在仅进行少量网络架构或超参数调整的情况下,能否在不同地质导向环境中实现良好泛化?
  • RQ5当传感器数据存在噪声或不完整时,RL如何处理不确定性下的顺序决策?这对实际部署有何影响?

主要发现

  • 在不同合成场景中,RL-Posterior方法相比贪心优化在价值函数上提升了19–33%。
  • RL-Sensor方法将计算时间从2,500秒减少至500秒,同时获得略高于RL-Posterior变体的奖励。
  • 在第二个场景中,RL获得的奖励与近似最优的DSDP(近似动态规划)解相当,差异无统计学显著性。
  • RL推理在10秒内完成1,000个储层实例的评估,而DSDP完成相同任务需4–5小时,评估速度提升约200倍。
  • DQN智能体仅需20分钟离线训练即可实现毫秒级实时推理性能,具备实际部署可行性。
  • RL的无模型特性使得通过在新模拟数据上微调即可无缝适应新地质导向环境,无需重新设计底层决策框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。