Skip to main content
QUICK REVIEW

[論文レビュー] Multi-agent Reinforcement Learning Accelerated MCMC on Multiscale Inversion Problem

Eric T. Chung, Yalchin Efendiev|arXiv (Cornell University)|Nov 17, 2020
Advanced Mathematical Modeling in Engineering参考文献 44被引用数 14
ひとこと要約

本稿では、多スケール逆問題におけるマルチレベルモンテカルロ・マルコフ連鎖(MCMC)サンプリングを高速化するため、マルチエージェント・アクタクリティック強化学習(RL)フレームワークを提案する。RLポリシーを用いて提案を生成し、集中型クリティックが長期報酬を推定することで、特に $\epsilon$-greedy戦略を組み合わせた場合に、サンプリング効率と収束速度が顕著に向上する。これは、高対比透水係数フィールドを有する時間依存型流れの逆問題において実証された。

ABSTRACT

In this work, we propose a multi-agent actor-critic reinforcement learning (RL) algorithm to accelerate the multi-level Monte Carlo Markov Chain (MCMC) sampling algorithms. The policies (actors) of the agents are used to generate the proposal in the MCMC steps; and the critic, which is centralized, is in charge of estimating the long term reward. We verify our proposed algorithm by solving an inverse problem with multiple scales. There are several difficulties in the implementation of this problem by using traditional MCMC sampling. Firstly, the computation of the posterior distribution involves evaluating the forward solver, which is very time consuming for a problem with heterogeneous. We hence propose to use the multi-level algorithm. More precisely, we use the generalized multiscale finite element method (GMsFEM) as the forward solver in evaluating a posterior distribution in the multi-level rejection procedure. Secondly, it is hard to find a function which can generate samplings which are meaningful. To solve this issue, we learn an RL policy as the proposal generator. Our experiments show that the proposed method significantly improves the sampling process

研究の動機と目的

  • 前処理ソルバーの評価が極めて高コストである多スケール逆問題におけるMCMCサンプリングの計算的ボトル neck を解消すること。
  • MCMCにおける有効な提案分布の設計の難しさを、強化学習による提案分布の学習によって克服すること。
  • マルチレベルMCMCとディープRLを統合し、粗スケールソルバーを活用して計算コストを低減すること。
  • 高対比・多スケール透水係数フィールドの逆問題におけるサンプリング効率と収束速度の向上を図ること。
  • チャnel化された特徴を有する時間依存型放物型PDEの逆問題に対して、提案手法の妥当性を検証すること。

提案手法

  • 各エージェントが局所的な状態情報に基づいてMCMCの提案を生成するポリシー(アクター)を学習するマルチエージェント・アクタクリティックRLフレームワークを設計する。
  • グローバル情報を利用し、長期報酬を推定する集中型クリティックを採用することで、効率的なポリシー最適化を実現する。
  • マルチレベルMCMCフレームワークにおける前処理ソルバーとして、一般化された多スケール有限要素法(GMsFEM)を用いることで、粗スケール評価を高速化する。
  • 粗スケールで早期に提案を却下することで、MCMCの受容プロセスを加速し、高価な細かいスケールの評価を回避する。
  • $\epsilon$-greedy戦略を用いて探索と活用のバランスを図り、確率 $p$ でRLポリシーを、確率 $1-p$ でランダムウォークを用いる。
  • 経験再生とターゲットネットワークを用いて学習を安定化させ、計算負荷を低減するため、報酬は最も粗いスケールの前処理ソルバーを用いて計算する。

実験結果

リサーチクエスチョン

  • RQ1マルチエージェントディープ強化学習は、多スケール逆問題におけるMCMCサンプリングの効率を向上させ得るか?
  • RQ2RLによって生成された提案と、従来のランダムウォークまたはカーネルベースの提案とを比較した場合、収束速度にどのような差が生じるか?
  • RQ3GMsFEMを用いたマルチレベルMCMCフレームワークは、高対比透水係数フィールドの逆問題において、計算コストをどの程度低減できるか?
  • RQ4$\epsilon$-greedy戦略は、RL加速MCMCフレームワークにおけるサンプリング品質と収束性にどのような影響を与えるか?
  • RQ5分散型アクターと集中型クリティックの組み合わせは、複雑な多スケール逆問題において、有効な提案分布を効果的に学習できるか?

主な発見

  • RLMCMC手法により、MCMCステップ数が標準MCMCの383ステップから174ステップに削減され、収束速度が顕著に向上した。
  • $\epsilon$-greedy戦略を用いたeRLMCMCバージョンは、より長いサンプリング軌道を延長することで、収束性を向上させたが、総計算時間は延長された。
  • eRLMCMCの総計算時間は13,472.4秒であり、RLMCMCの6,062.4秒よりも長かった。これは、より大きな $\epsilon$ 値による拒否回数の増加に起因した。
  • マルチレベルMCMCフレームワークにGMsFEMを用いることで、粗スケール評価が効率的に行えるようになり、却下プロセスが加速された。
  • 分散型アクターと集中型クリティックの組み合わせにより、標準的なランダムウォーク提案よりも優れたサンプリング効率を達成する提案ポリシーを効果的に学習できた。
  • 本手法は、対角線に沿ったチャネル化された透水係数フィールドを有する時間依存型流れの逆問題において、優れた性能を示し、高対比環境下でも頑健であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。