Skip to main content
QUICK REVIEW

[論文レビュー] Optimal sequential decision making with probabilistic digital twins

Christian Agrell, Kristina Rognlien Dahl|arXiv (Cornell University)|Mar 12, 2021
Formal Methods in Verification被引用数 4
ひとこと要約

本稿は、測度論的条件付き確率とσ代数を用いて形式化された、認識的不確実性下での最適逐次意思決定のための確率的デジタルツイン(PDT)フレームワークを提案する。セット構造のニューラルネットワークを用いた深層強化学習(RL)手法を提案し、高次元かつ部分的に観測可能な意思決定問題を解く。故障確率推定のための最適な情報収集において、ベースライン方策の60%に対して94%の成功率を達成し、優れた性能を示した。

ABSTRACT

Digital twins are emerging in many industries, typically consisting of simulation models and data associated with a specific physical system. One of the main reasons for developing a digital twin, is to enable the simulation of possible consequences of a given action, without the need to interfere with the physical system itself. Physical systems of interest, and the environments they operate in, do not always behave deterministically. Moreover, information about the system and its environment is typically incomplete or imperfect. Probabilistic representations of systems and environments may therefore be called for, especially to support decisions in application areas where actions may have severe consequences. In this paper we introduce the probabilistic digital twin (PDT). We will start by discussing how epistemic uncertainty can be treated using measure theory, by modelling epistemic information via $σ$-algebras. Based on this, we give a formal definition of how epistemic uncertainty can be updated in a PDT. We then study the problem of optimal sequential decision making. That is, we consider the case where the outcome of each decision may inform the next. Within the PDT framework, we formulate this optimization problem. We discuss how this problem may be solved (at least in theory) via the maximum principle method or the dynamic programming principle. However, due to the curse of dimensionality, these methods are often not tractable in practice. To mend this, we propose a generic approximate solution using deep reinforcement learning together with neural networks defined on sets. We illustrate the method on a practical problem, considering optimal information gathering for the estimation of a failure probability.

研究の動機と目的

  • 測度論とσ代数を用いてデジタルツインにおける認識的不確実性を形式化し、適切な条件付き確率を実現する。
  • 不確実性の伝播と新規情報受容に伴う動的更新を可能にする確率的デジタルツイン(PDT)を定義する。
  • PDTフレームワーク内での最適逐次的意思決定を、部分的に観測可能なマルコフ意思決定過程(POMDP)として定式化する。
  • 高次元かつ計算的に扱いにくい問題に対して、スケーラブルな近似解法を深層強化学習を用いて開発する。
  • 実用的問題として、実験選択の最適化によるリソースコスト最小化という、故障確率推定のための意思決定問題に本手法を適用する。

提案手法

  • σ代数による測度論的条件付き確率を用いて、情報状態を表現することで、認識的不確実性を形式化する。
  • PDTをベイズモデルとして定義し、シミュレーション、データ、不確実性の伝播を統合する。
  • 逐次的意思決定を、行動が信念状態に影響し、結果が確率的に観測されるPOMDPとしてモデル化する。
  • 情報状態上の価値関数を表現するため、セット構造のニューラルネットワークを用いたDQNベースのエージェントを提案する深層RLソリューションを構築する。
  • 経験再生とターゲットネットワークを実装し、高次元の信念空間における安定した方策学習を可能にする。
  • 実験コスト(例:測定は-10、有限要素解析は-0.1)をペナルティとする報酬関数を用い、40回までの実験制限内で総コストを最小化する。

実験結果

リサーチクエスチョン

  • RQ1認識的不確実性は、測度論的基礎に立脚してどのように形式的に表現され、更新可能か?
  • RQ2最適な逐次的意思決定を実現するため、確率的デジタルツインはどのように構造化されるべきか?
  • RQ3高次元のPDT問題において、伝統的な動的計画法や最適制御の最大原理法にはどのような限界があるか?
  • RQ4深層強化学習は、PDTにおける最適な情報収集のためのスケーラブルで実用的なソリューションを提供できるか?
  • RQ5提案されたRLベースの方策は、ランダム方策およびヒューリスティック方策と比較して、成功確率およびコスト効率においてどのように優れているか?

主な発見

  • 深層強化学習エージェントは、40回の実験以内に故障確率を推定する作業で94%の成功率を達成した。これはランダム方策の60%の成功率を大きく上回った。
  • RLベースの方策は、不確実性低減に基づき、低コスト(FE)、中コスト(ラボ)、高コスト(測定)の実験を知的に選択することで、総コストを最小化した。
  • 経験再生とターゲットネットワークの使用は、高次元の信念空間におけるDQNエージェントの安定した学習と収束に不可欠であった。
  • セット構造のニューラルネットワークアーキテクチャを用いることで、情報状態を効率的に表現し、次元の呪いを効果的に扱った。
  • 本手法はリスクを考慮した意思決定を可能とし、最大原理に基づくアプローチを用いて、時不変でないリスク測度(例:CVaR)への拡張も可能である。
  • 本アプローチにより、情報利得とリソースコストのバランスを取った、リアルタイムでデータ駆動型の意思決定支援が、安全が求められるシステムにおいて可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。