Skip to main content
QUICK REVIEW

[論文レビュー] Causally Correct Partial Models for Reinforcement Learning

Danilo Jimenez Rezende, Ivo Danihelka|arXiv (Cornell University)|Feb 7, 2020
Reinforcement Learning in Robotics参考文献 45被引用数 16
ひとこと要約

本稿では、部分モデルにおける交絡要因の問題を、潜在的なバックドア変数を組み込むことで因果的に正しい部分モデル(CPM)を強化学習に導入する。完全な観測モデルを必要とせず、因果的に正確な計画を保証する。この手法は、交絡要因を明示的にモデル化することで、確率的環境において非因果的部部分モデルを上回るポリシー評価および計画性能を達成し、計算コストの増加を最小限に抑える。

ABSTRACT

In reinforcement learning, we can learn a model of future observations and rewards, and use it to plan the agent's next actions. However, jointly modeling future observations can be computationally expensive or even intractable if the observations are high-dimensional (e.g. images). For this reason, previous works have considered partial models, which model only part of the observation. In this paper, we show that partial models can be causally incorrect: they are confounded by the observations they don't model, and can therefore lead to incorrect planning. To address this, we introduce a general family of partial models that are provably causally correct, yet remain fast because they do not need to fully model future observations.

研究の動機と目的

  • モデルベース強化学習で用いられる既存の部分モデルにおける因果的欠陥を特定および形式化すること。
  • 観測がモデル化されていない場合に生じる交絡要因の問題に対処し、因果的推論が歪められ、誤った計画が導かれる状況を解消すること。
  • 完全な観測モデルを回避しつつ、証明可能に因果的に正しい、一般化可能な部分モデルの族を開発すること。
  • 単純なMDP、MiniPacman、3D環境において、提案されたCPMフレームワークの実証的検証を行い、ポリシー評価および計画の正確性が向上することを示すこと。

提案手法

  • 潜在的なバックドア変数(未観測の交絡要因を表す)を条件付けすることで、部分モデルが因果的に正しいとされる因果フレームワークを提案する。
  • RNNエンコーダーの隠れ状態 $ h_t $ を入力として、潜在的バックドア変数 $ z_t $ の条件付き分布 $ p(z_t | h_t) $ を学習するモデルアーキテクチャを導入する。
  • バックドア変数の分布 $ p(z_t | h_t) $ を、深層ニューラルネットワークによってパラメータ化された集中パrameterを持つディリクレ混合分布でモデル化する。これにより、バックドア変数の不確実性と構造を捉える。
  • 2段階の訓練プロセスを採用する:まず、行動と隠れ状態から将来の観測を予測するようにモデルを事前学習し、次に因果的目的関数で微調整して、モデルの予測をポリシーの結果と一致させる。
  • 反事後的介入の下で、強制的な行動と強制的なバックドア変数の両方を用いて、モデルの挙動を評価するためのロールアウトを実施する。
  • 1つの軌道に対して複数のサンプリングポイントを用いた条件付き生成損失を採用することで、モデルの頑健性と不確実性推定を向上させる。

実験結果

リサーチクエスチョン

  • RQ1モデルベース強化学習における部分モデルが、分布予測において正確であっても、未モデル化された交絡要因のため因果的に誤りになり得るか?
  • RQ2ポリシー変更の下で因果的正確性を保証するために、部分モデルに含める必要のある最小限の変数の集合は何か?
  • RQ3完全な観測モデルを回避することで、因果的に正しいと同時に計算的に効率的な部分モデルを構築できるか?
  • RQ4潜在的バックドア変数の導入が、確率的環境におけるポリシー評価および計画の精度をどのように向上させるか?

主な発見

  • FuzzyBearおよびAvoidFuzzyBear MDPにおいて、非因果的部分モデル(NCPM)は、森へ訪問するポリシーを最適と誤って評価するが、真の最適ポリシーは自宅にとどまるものである。
  • 因果的に正しい部分モデル(CPM)は、AvoidFuzzyBearにおいて自宅にとどまることを正しく特定し、すべてのポリシーに対して一定の評価値0.6を示し、真の最大期待報酬と一致する。
  • MiniPacmanでは、CPMがNCPMを上回るポリシー評価性能を示し、500個のランダムに生成されたポリシーにおける価値推定の平均二乗誤差が低くなる。
  • 3D環境では、CPMは初期学習段階において多様で現実的なロールアウトを維持するが、NCPMはポリシーがより決定的になると過剰に楽観的になる。
  • CPMは、交絡要因として機能する潜在的バックドア変数を明示的にモデル化することで、ポリシー変更に強く、誤った相関関係を避ける。
  • 非ゼロの探索($\varepsilon$-探索)を用いることで、CPMはロールアウトにおける過信を回避し、後期の学習段階でも正確な不確実性推定を維持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。