Skip to main content
QUICK REVIEW

[論文レビュー] Which Mutual-Information Representation Learning Objectives are Sufficient for Control?

Kate Rakelly, Abhishek Gupta|arXiv (Cornell University)|Jun 14, 2021
Reinforcement Learning in Robotics参考文献 67被引用数 8
ひとこと要約

この論文は、強化学習(RL)における相互情報量(MI)表現学習目的が理論的に十分である条件を分析し、$ω_{state}$ および $ω_{inv}$ という2つの広く使われている目的関数が、ややきめのM DP仮定のもとでも不十分な表現を生じ得ることを示している。一方、$ω_{fwd}$ は理論的に十分であることが証明されている。視覚的RL環境における実験結果から、不十分な表現は、特に干渉要因の多い観測条件下でRL性能を著しく低下させることも確認された。

ABSTRACT

Mutual information maximization provides an appealing formalism for learning representations of data. In the context of reinforcement learning (RL), such representations can accelerate learning by discarding irrelevant and redundant information, while retaining the information necessary for control. Much of the prior work on these methods has addressed the practical difficulties of estimating mutual information from samples of high-dimensional observations, while comparatively less is understood about which mutual information objectives yield representations that are sufficient for RL from a theoretical perspective. In this paper, we formalize the sufficiency of a state representation for learning and representing the optimal policy, and study several popular mutual-information based objectives through this lens. Surprisingly, we find that two of these objectives can yield insufficient representations given mild and common assumptions on the structure of the MDP. We corroborate our theoretical results with empirical experiments on a simulated game environment with visual observations.

研究の動機と目的

  • 強化学習における最適方策学習のための表現の十分性の概念を形式化すること。
  • マークフ・決定過程(MDP)における一般的なMIベースの表現学習目的の理論的十分性を評価すること。
  • 標準的なMDP仮定のもとでも、必要な状態情報が捉えられていない場合がある、という目的関数を同定すること。
  • 視覚的観測と干渉要因を含む深層RLエージェントを用いて、理論的発見を実証的に検証すること。
  • 有効なRL方策学習を支援する可能性を有する新しいMIベースの目的関数を評価するフレームワークを提供すること。

提案手法

  • 表現の十分性の形式的定義を提唱:表現が任意の報酬関数に対して最適Q関数の学習を可能にする必要がある。
  • 3つのMI目的関数の分析:$ω_{fwd}$(前方予測)、$ω_{inv}$(逆予測)、$ω_{state}$(状態予測)。
  • 正確なMI計算を伴う教育的MDP例を用いて、$ω_{state}$ および $ω_{inv}$ がややきめの仮定のもとで理論的に不十分であることを証明。
  • すべての報酬関数に対して最適Q関数を表現可能であるという点で、$ω_{fwd}$ が十分であることを証明。
  • 視覚的観測を用いた深層RL実験では、ノイズ対比推定法を用いてMI推定を実施。
  • 模擬ゲーム環境で、視覚的干渉要因あり・なしの両状況において、各目的関数で学習した表現を用いてRLエージェントを訓練。

実験結果

リサーチクエスチョン

  • RQ1一般のMDPにおいて、どのMIベースの表現学習目的関数が最適方策学習に理論的に十分であるか?
  • RQ2$ω_{state}$ や $ω_{inv}$ のような一般的に使われる目的関数が、単純なMDPでも必要な状態情報を捉えられていないことがあるか?
  • RQ3理論的に不十分な表現目的関数が、視覚的入力を用いた深層RLにおいて、測定可能な性能劣化を引き起こすか?
  • RQ4理論的に不十分な目的関数が、現実的または部分観測設定において十分になるMDPのクラスは存在するか?
  • RQ5ゼロ歪み解が達成された場合、変分オートエンコーダーのELBOがRLに十分である可能性はあるか?

主な発見

  • $ω_{fwd}$(現在状態と将来状態の間の相互情報量を最大化する目的)は、一般のMDP仮定のもとで、最適Q関数を表現する点で理論的に十分であることが証明された。
  • $ω_{state}$ および $ω_{inv}$ は理論的に不十分であり、それらは、予測可能ではあるが最適制御に不可欠な状態情報が捉えられていない場合がある。
  • 干渉要因を含む模擬視覚的RL環境において、$ω_{inv}$ で学習した表現はキャッチャー・ゲームで果物オブジェクトを追跡できず、果物誤差が0.47に達したのに対し、$ω_{fwd}$ では0.14にとどまった。
  • キャッチャー・グリップ環境では、$ω_{state}$ はグリッパー状態を正しく表現できず、グリップ誤差が0.50に達したが、$ω_{fwd}$ ではわずか0.12の誤差にとどまった。
  • 視覚的干渉要因が存在する環境では、十分な目的関数と不十分な目的関数の間の性能差が拡大しており、不十分な目的関数が不要な情報にだまされやすいことが示された。
  • 理論的不十分性と実験的性能劣化が直接相関しており、視覚的深層RLにおいて表現の質が重要なボトル neck であることが実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。