Skip to main content
QUICK REVIEW

[論文レビュー] Causal Dynamics Learning for Task-Independent State Abstraction

Zizhao Wang, Xuesu Xiao|arXiv (Cornell University)|Jun 27, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本稿では、条件付き独立性検定を用いて状態変数と行動の間の誤った依存関係を同定・除去することで、因果的ダイナミクスモデルを学習するCausal Dynamics Learning (CDL) を提案する。この手法により、タスクに依存しない状態抽象化が可能となり、モデルベース強化学習における汎化性能とサンプル効率が向上し、シミュレート環境において未学習状態および下流タスクで密度モデルを上回る性能を発揮する。

ABSTRACT

Learning dynamics models accurately is an important goal for Model-Based Reinforcement Learning (MBRL), but most MBRL methods learn a dense dynamics model which is vulnerable to spurious correlations and therefore generalizes poorly to unseen states. In this paper, we introduce Causal Dynamics Learning for Task-Independent State Abstraction (CDL), which first learns a theoretically proved causal dynamics model that removes unnecessary dependencies between state variables and the action, thus generalizing well to unseen states. A state abstraction can then be derived from the learned dynamics, which not only improves sample efficiency but also applies to a wider range of tasks than existing state abstraction methods. Evaluated on two simulated environments and downstream tasks, both the dynamics model and policies learned by the proposed method generalize well to unseen states and the derived state abstraction improves sample efficiency compared to learning without it.

研究の動機と目的

  • 密度的なダイナミクスモデルに生じる誤った相関が原因で生じるモデルベース強化学習の汎化性能の低さを是正すること。
  • 状態変数と行動の間の必要な依存関係のみを同定する因果的ダイナミクスモデルの構築。
  • 因果モデルからタスクに依存しない状態抽象化を導出し、多様なタスクにわたるサンプル効率と汎化性能の向上。
  • 将来のタスクに有用な制御可能な変数を無視する可能性がある報酬依存型抽象化(例:bisimulation)の限界を克服すること。

提案手法

  • 本手法は、ダイナミクスモデルにおける状態変数と行動の間の誤った依存関係を同定・除去するための条件付き独立性検定を用いる。
  • エンドツーエンドのダイナミクスモデル学習中に条件付き相互情報量を推定する、新しいニューラルアーキテクチャを提案する。
  • 因果的影響に基づいて、状態変数を制御可能、行動関連、行動無関連の変数に分割する。
  • 得られた状態抽象化は、行動無関連変数(例:時計)を除外しつつ、計画に必要な動的関係を保持する。
  • スパarsな因果的正確なモデルによる計画が可能となり、分布外状態への汎化性能が向上する。
  • 多様な探索方策(PredDiff、Uniform、Curiosityを含む)によって収集されたデータを用いて、手法のロバスト性を評価する。

実験結果

リサーチクエスチョン

  • RQ1オフラインデータから学習した因果的ダイナミクスモデルは、誤った相関を除去することで、未学習状態に対しても良好な汎化性能を示せるか?
  • RQ2因果構造の同定は、密度モデルと比較して下流の強化学習タスクにおけるサンプル効率をどのように向上させるか?
  • RQ3動的要因から純粋に導出された状態抽象化は、タスクに依存せず、多様なタスクにわたる汎化を可能にするか?
  • RQ4異なる探索戦略は、学習された因果グラフの品質およびその後のモデル性能にどのように影響するか?

主な発見

  • CDLは未学習状態においてほぼ完全な汎化性能を達成し、未学習状態の予測精度が学習済み状態と同等に保たれた一方で、密度モデルは複雑な環境において60–90%の精度低下を示した。
  • 報酬依存型の抽象化とは異なり、好奇心に基づく探索によって収集されたデータからでも、CDLは正確な因果グラフを学習できたが、延期行動の影響により再現率は低かった。
  • 導出された因果的状態抽象化を用いて訓練された方策は、すべての下流タスクにおいて密度モデルを用いた場合と比較して、より高いサンプル効率と優れた汎化性能を示した。
  • 状態抽象化は、行動無関連変数(例:時計)を効果的に除外しながら、制御可能および行動関連変数を保持しており、報酬依存型抽象化よりも広範なタスク適合性を実現した。
  • 化学的および操作的環境の両方において、CDLは最先端の密度モデルを上回り、汎化性能とサンプル効率の両面で一貫した改善を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。