Skip to main content
QUICK REVIEW

[論文レビュー] Real-Time Model Calibration with Deep Reinforcement Learning

Yuan Tian, Manuel Arias Chao|arXiv (Cornell University)|Jun 7, 2020
Fault Detection and Control Systems参考文献 48被引用数 12
ひとこと要約

本論文では、ノイズの多い観測データから物理ベースのモデルパラメータをリアルタイムで、かつロバストかつ正確にキャリブレーションできるようにする、深層強化学習フレームワークを提案する。モデルキャリブレーションをトラッキング問題に再定式化することで、カルマンフィルターやエンドツーエンドの深層学習といった従来手法と比較して、より高速かつ安定した性能を達成し、ノイズの多いデータセットにおいて推論精度を4倍に向上させた。

ABSTRACT

The dynamic, real-time, and accurate inference of model parameters from empirical data is of great importance in many scientific and engineering disciplines that use computational models (such as a digital twin) for the analysis and prediction of complex physical processes. However, fast and accurate inference for processes with large and high dimensional datasets cannot easily be achieved with state-of-the-art methods under noisy real-world conditions. The primary reason is that the inference of model parameters with traditional techniques based on optimisation or sampling often suffers from computational and statistical challenges, resulting in a trade-off between accuracy and deployment time. In this paper, we propose a novel framework for inference of model parameters based on reinforcement learning. The contribution of the paper is twofold: 1) We reformulate the inference problem as a tracking problem with the objective of learning a policy that forces the response of the physics-based model to follow the observations; 2) We propose the constrained Lyapunov-based actor-critic (CLAC) algorithm to enable the robust and accurate inference of physics-based model parameters in real time under noisy real-world conditions. The proposed methodology is demonstrated and evaluated on two model-based diagnostics test cases utilizing two different physics-based models of turbofan engines. The performance of the methodology is compared to that of two alternative approaches: a state update method (unscented Kalman filter) and a supervised end-to-end mapping with deep neural networks. The experimental results demonstrate that the proposed methodology outperforms all other tested methods in terms of speed and robustness, with high inference accuracy.

研究の動機と目的

  • ノイズが多く、高次元的かつ動的な条件下でも、リアルタイムで正確かつロバストに物理ベースのモデルパラメータを推論する課題に対処すること。
  • 実世界の応用において、従来の最適化やサンプリングに基づく推論手法に見られる計算的・統計的限界を克服すること。
  • 訓練に真のキャリブレーションパラメータを必要としない、スケーラブルでシミュレーションで訓練されたフレームワークを構築すること。
  • 学習された方策を用いて、観測されたシステム行動を正確に追跡することで、航空機エンジンのような安全が重要なシステムにおけるリアルタイム診断を可能にすること。
  • 逆問題を明示的に解かずに、同時にシステムの物理的性質とパラメータキャリブレーションの推論メカニズムを学習できるかを実証すること。

提案手法

  • 方策がモデル出力を観測データに一致させるように、モデルキャリブレーションを強化学習のトラッキング問題に再定式化する。
  • ノイズの多い観測下でも学習を安定化させ、方策の収束を保証するため、制約付きラプラノフに基づくアクタ・クリティック(CLAC)アルゴリズムを導入する。
  • 深層ニューラルネットワーク方策を用い、モデル状態と観測値をパラメータ更新にマッピングする。最大エントロピー強化学習により訓練する。
  • 特にモデル不確実性やノイズの下でも安定性を高め、方策の分散を低減するために、ラプラノフに基づく制約を組み込む。
  • 真のパラメータを必要とせず、物理ベースのモデルと観測データのみを用いて、シミュレーション環境でフレームワーク全体を訓練する。
  • 下位の物理ベースのシミュレーションに忠実なまま推論を高速化するために、サーヴィレートDNNモデルを活用する。

実験結果

リサーチクエスチョン

  • RQ1ノイズが多く、高次元的な条件下でも、強化学習を用いて物理ベースのモデルをリアルタイムでキャリブレーションできるか?
  • RQ2観測ノイズやモデルノイズが存在する状況において、CLACアルゴリズムは標準的なアクタ・クリティック手法と比較して、どのようにロバスト性と安定性を向上させるか?
  • RQ3真のキャリブレーションパラメータにアクセスできない状況下で、深層強化学習方策が未観測の劣化経路にどの程度一般化できるか?
  • RQ4カルマンフィルターやエンドツーエンドの深層学習といった既存手法と比較して、本手法の精度と速度はどのように異なるか?
  • RQ51つの強化学習フレームワークが、同時にシステムの物理的性質とパラメータキャリブレーションの推論メカニズムを学習できるか?

主な発見

  • CLACアルゴリズムは、LACベースラインと比較して推論精度を4倍に向上させ、データセット#1ではRMSEを1.3e-3から3.3e-4に低下させた。
  • データセット#1において、CLACはRMSE 0.98を達成し、わずかに高い誤差ではあるが、UKF(RMSE 0.62)よりも優れた一般化性能と安定性を示した。
  • データセット#2では、RMSEが5.54にとどまり、DNNモデルがノイズが多く精度が低い状況下でも、優れた性能を発揮した。
  • CLAC方策は、ノイズが多く、変動が激しい状況下でも、LAC方策と比較して著しく分散が小さく、真の行動に近づいていることが確認された。
  • 本フレームワークは、逆問題を解くことなく、真のパラメータを必要とせず、モデルと観測データのみに依存してリアルタイムのキャリブレーションを可能にした。
  • 本手法は未観測の劣化経路に対しても良好に一般化しており、実世界の展開において優れた転送性とロバスト性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。