Skip to main content
QUICK REVIEW

[論文レビュー] Model-Free Adaptive Optimal Control of Sequential Manufacturing Processes using Reinforcement Learning.

Johannes Dornheim, Norbert Link|arXiv (Cornell University)|Sep 18, 2018
Advanced Control Systems Optimization参考文献 33被引用数 3
ひとこと要約

本論文は、Q学習に基づく強化学習を用いて、事前プロセスモデルが不要なモデルフリーな適応最適制御フレームワークを、逐次的製造工程に対して提案している。リアルタイムの製品品質フィードバックから直接最適制御方策を学習することで、有限要素法(FEM)シミュレーションを用いた深絞り工程において、モデルベース手法(モデル予測制御や近似動的プログラミング)を上回る優れた性能を達成している。

ABSTRACT

A self-learning optimal control algorithm for sequential manufacturing processes with time-discrete control actions is proposed and evaluated with simulated deep drawing processes. The necessary control model is built during consecutive process executions under optimal control via Reinforcement Learning, using the measured product quality as reward after each process execution. Prior model formation, which is required by state-of-the-art algorithms like Model Predictive Control and Approximate Dynamic Programming, is therefore obsolete. This avoids the difficulties in system identification and accurate modelling, which arise with processes subject to non-linear dynamics and stochastic influences. Also runtime complexity problems of these approaches are avoided, which arise when more complex models and larger control prediction horizons are employed. Instead of using pre-created process- and observation-models, Reinforcement Learning algorithms build functions of expected future reward during processing, which are then used for optimal process control decisions. The learning of such expectation functions is realized online by interacting with the process. The proposed algorithm also takes stochastic variations of the process conditions into consideration and is able to cope with partial observability. A method for the adaptive optimal control of partially observable fixed-horizon manufacturing processes, based on Q-learning is developed and studied. The resulting algorithm is instantiated and then evaluated by application to a time-stochastic optimal control problem in metal sheet deep drawing, where the experiments use FEM-simulated processes. The Reinforcement Learning based control shows superior results over the model-based Model Predictive Control and Approximate Dynamic Programming approaches.

研究の動機と目的

  • 逐次的製造工程の最適制御において、事前プロセスモデルの必要性を排除すること。
  • 非線形的かつ確率的なプロセスにおけるシステム同定およびモデル精度の課題に対処すること。
  • 従来の最適制御手法における複雑なモデルおよび長い予測予測期間に起因する実行時間の複雑さを軽減すること。
  • 部分的に観測可能で時間的に確率的な製造環境における適応制御を可能にすること。
  • 深絞り工程における固定予測期間の最適制御のためのQ学習ベースのアルゴリズムの開発および評価すること。

提案手法

  • 強化学習を用いて、各工程サイクル後の測定された製品品質から得られる将来の報酬の期待値を表す価値関数を学習する。
  • 事前に定義されたプロセスモデルや観測モデルを必要とせず、物理的プロセスとのオンライン相互作用を通じて最適制御方策を学習する。
  • 部分的観測性およびプロセス状態の確率的変動を扱うために、Q学習に基づくアプローチを採用する。
  • 時間的に離散的な制御フレームワーク内で動作し、シミュレートされた深絞りプロセスからのリアルタイムフィードバックに基づいて方策を更新する。
  • 将来の報酬の期待関数を構築する学習プロセスにより、明示的なシステムダイナミクスモデルなしに最適制御意思決定をガイドする。
  • 有限要素法(FEM)を用いたシミュレートされた深絞りプロセスを用いて、アルゴリズムを実装および評価する。

実験結果

リサーチクエスチョン

  • RQ1事前システムモデルが不要なモデルフリーな強化学習アプローチは、逐次的製造工程における最適制御を達成できるか?
  • RQ2提案されたRLベースの手法は、モデル予測制御(MPC)や近似動的プログラミング(ADP)といったモデルベース手法と比較して、どのように性能を発揮するか?
  • RQ3RL手法は、製造工程における確率的変動および部分的観測性をどの程度効果的に処理できるか?
  • RQ4システム同定およびモデルの複雑さを排除することで、制御の実行時間および適応性にどのような影響が生じるか?
  • RQ5RLアルゴリズムは、シミュレートされた深絞りプロセスにおいて、製品品質フィードバックから直接有効な制御方策を学習できるか?

主な発見

  • 提案された強化学習ベースの制御手法は、FEMシミュレーションを用いた深絞りプロセスにおいて、モデル予測制御(MPC)および近似動的プログラミング(ADP)の両方を制御性能面で上回っている。
  • 本手法は、事前プロセスモデルの必要性を排除することで、システム同定およびモデル精度の課題を回避している。
  • アルゴリズムは、製造プロセスにおける確率的変動および部分的観測性を効果的に処理し、頑健な制御性能を維持している。
  • 複雑なモデルおよび長い予測予測期間に依存するモデルベース手法と比較して、実行時間の複雑さが顕著に低減されている。
  • 学習プロセスは、製品品質を唯一の報酬信号として、プロセスとの直接的相互作用を通じて最適制御方策に収束する。
  • 結果は、非線形的で複雑な製造環境における適応的最適制御の観点から、モデルフリーなRLの実現可能性および優位性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。