Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Process Synthesis

Laurence Illing Midgley|arXiv (Cornell University)|Sep 23, 2020
Process Optimization and Integration参考文献 8被引用数 4
ひとこと要約

本稿では、プロセスシミュレータ(COCOおよびChemSep)と連携する強化学習(RL)環境「Distillation Gym」を紹介する。Soft Actor-Critic(SAC)を用いて、ベンゼン-トロリエン-pキシレンおよび炭化水素分離問題の高回収・高収益な設計を学習し、プロセス合成をRLタスクとして定式化する可能性を示した。また、化学工学用一般用途ツールキット「Chemical Engineering Gym」の提案も行った。

ABSTRACT

This paper demonstrates the application of reinforcement learning (RL) to process synthesis by presenting Distillation Gym, a set of RL environments in which an RL agent is tasked with designing a distillation train, given a user defined multi-component feed stream. Distillation Gym interfaces with a process simulator (COCO and ChemSep) to simulate the environment. A demonstration of two distillation problem examples are discussed in this paper (a Benzene, Toluene, P-xylene separation problem and a hydrocarbon separation problem), in which a deep RL agent is successfully able to learn within Distillation Gym to produce reasonable designs. Finally, this paper proposes the creation of Chemical Engineering Gym, an all-purpose reinforcement learning software toolkit for chemical engineering process synthesis.

研究の動機と目的

  • 強化学習をプロセス合成に効果的に適用できることを示すため、蒸留塔設計を段階的意思決定タスクとして定式化すること。
  • プロセスシミュレータ(COCOおよびChemSep)と連携する機能的なRL環境(Distillation Gym)を構築し、シミュレーションベースの学習を可能にすること。
  • ベンゼン-トルエン-pキシリレンおよび炭化水素混合物といった実世界の分離問題に対して、本アプローチを検証し、エージェントが収益性・高回収性を兼ね備えた設計を学習できることを示すこと。
  • 蒸留にとどまらず、多様なユニット操作およびプロセストポロジーを含む一般用途のRLツールキットとしての「Chemical Engineering Gym」を提案すること。
  • 従来の最適化フレームワーク(パrameterチューニング)から、意思決定シーケンスフレームワーク(プロセス合成を行動のシーケンスとして扱う)へのシフトを提唱し、よりオープンエンドで革新的な設計探索を可能にすること。

提案手法

  • エージェントは、状態(原料組成、条件)を観測し、行動(蒸留塔設定、分流比)を選択し、製品の純度、回収率、収益に基づいて報酬を受ける、マルコフ決定過程(MDP)として構造化されている。
  • エージェントは、探索と活用のバランスを保つためにエントロピー正則化を用いる深層強化学習アルゴリズムであるSoft Actor-Critic(SAC)を採用。サンプル効率と安定性が向上する。
  • クライアントネットワークは、ターゲットネットワークとソフト更新を用いた二重Qネットワーク構造を採用し、経験のリプレイバッファ上でのベルマン誤差を最小化することで、学習を安定化させる。
  • エージェントのアクターネットワークは、再パrameter化トリックを用い、微分可能なポリシー最適化を可能にし、ノイズを含む行動を用いた勾配ベースのポリシー更新を実現する。
  • 各行動の後、COCOおよびChemSepシミュレータと統合し、分離性能(エネルギー、コスト)を計算することで、正確な状態遷移と報酬信号を提供する。
  • 問題仕様はユーザー定義であり、成分の物性、原料ストリームの条件、製品純度の目標、市場価格を含む。これにより、柔軟かつ汎用的な問題定義が可能となる。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習を用いて、蒸留塔設計を段階的意思決定タスクとして定式化することで、プロセス合成問題を効果的に解けるか?
  • RQ2事前の最適化やヒューリスティック則なしに、エージェントが高回収・高収益な蒸留構成を学習できる程度はどの程度か?
  • RQ3プロセスシミュレータ(COCO/ChemSep)とエージェントを統合することで、学習中に正確かつ現実的な性能評価が可能になるか?
  • RQ4複雑な多成分分離において、エージェントが回収率とコストの主なトレードオフをどのようにバランスさせるかを学習できるか?
  • RQ5本RLベースのアプローチは、蒸留を越えて他のユニット操作やプロセストポロジーへ一般化可能か?そのスケーラビリティを支えるインfraは何か?

主な発見

  • 深層RLエージェントはベンゼン-トルエン-pキシリレン(BTX)分離問題に対して、ベンゼンで98.2%、トルエンで99.7%、pキシリレンで99.9%を超える回収率を達成し、合計収益0.45百万ドルを獲得した。
  • 炭化水素分離問題では、プロパンで98.9%、イソブタンで97.3%、nブタンで91.1%、イソペンタンで99.6%、nペンタンで97.0%の高い回収率を達成し、合計収益15億8800万ドルを生成した。
  • BTX問題におけるエージェントの最良設計は、バルブ-蒸留塔ペアを備えた単一ブロックフローシートとして自動生成され、構造の単純さと実現可能性を示した。
  • 複数回の学習ランにおいてもエージェントの性能は安定しており、SACを用いたDistillation Gym環境における学習ダイナミクスの安定性が裏付けられた。
  • 結果は、RLが事前のヒューリスティックやMINLPベースの最適化に依存せずに、非自明で収益性の高いプロセス構成を発見できることを検証した。
  • 著者らは、パrameter最適化ではなく意思決定のシーケンスとしてプロセス合成を定式化することで、より柔軟で革新的な設計探索が可能になると結論づけた。特に、Chemical Engineering Gymのような包括的ツールキットに拡張した場合に顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。