Skip to main content
QUICK REVIEW

[論文レビュー] Mutual Information Maximization for Robust Plannable Representations

Yiming Ding, Ignasi Clavera|arXiv (Cornell University)|May 16, 2020
Reinforcement Learning in Robotics参考文献 18被引用数 7
ひとこと要約

MIROは、モデルベース強化学習におけるロバストで計画可能な潜在表現を学習するための相互情報最大化アプローチを提案する。ノイズ対比推定器を用いて、潜在状態と将来の観測値の間の相互情報量を最適化することで、再構成ベースの手法と比較して視覚的ごみやごみだらけのシーンに対して優れたロバスト性を達成する一方で、標準的な制御ベンチマークでも優れた性能を維持する。

ABSTRACT

Extending the capabilities of robotics to real-world complex, unstructured environments requires the need of developing better perception systems while maintaining low sample complexity. When dealing with high-dimensional state spaces, current methods are either model-free or model-based based on reconstruction objectives. The sample inefficiency of the former constitutes a major barrier for applying them to the real-world. The later, while they present low sample complexity, they learn latent spaces that need to reconstruct every single detail of the scene. In real environments, the task typically just represents a small fraction of the scene. Reconstruction objectives suffer in such scenarios as they capture all the unnecessary components. In this work, we present MIRO, an information theoretic representational learning algorithm for model-based reinforcement learning. We design a latent space that maximizes the mutual information with the future information while being able to capture all the information needed for planning. We show that our approach is more robust than reconstruction objectives in the presence of distractors and cluttered scenes

研究の動機と目的

  • モデルフリー強化学習のサンプル非効率性と、再構成ベースのモデルベース強化学習における不要な詳細への過剰適合を解消すること。
  • 高次元の観測値に含まれるノイズや干渉要因を除外し、タスクに必要なダイナミクスのみを捉える潜在空間を学習すること。
  • 情報理論的表現学習を用いて、視覚的ごみや摂動が生じる現実世界の環境におけるロバスト性を向上させること。
  • 視覚的ノイズ下でも計画性能を維持しながら、サンプル効率性を達成する手法を開発すること。
  • 相互情報最大化が再構成目的よりもよりロバストで一般化可能な表現をもたらすことを示すこと。

提案手法

  • 本手法は、潜在状態と将来の観測値の間の相互情報量のノイズ対比推定器(NCE)下界を最適化する。
  • 分布の仮定を避けるためにエネルギーに基づくモデルを用い、潜在表現の判別的学習を可能にする。
  • 潜在空間は予測モデル、報酬予測器、フィルタリング関数と同時に、エンドツーエンドの学習によって学習される。
  • 潜在遷移モデルに再パラメータライゼーションのテクニックを適用し、微分可能なサンプリングとバックプロパゲーションを可能にする。
  • 計画には、交差エントロピー法(CEM)を用いたモデル予測制御(MPC-CEM)を用い、オンラインでのデータ収集とモデル再学習を実施する。
  • NCE目的関数における負例は、将来の観測値のバッチから抽出される。

実験結果

リサーチクエスチョン

  • RQ1視覚的干渉要因が存在する状況で、相互情報最大化が再構成ベースの目的関数よりもロバストな潜在表現を生成できるか?
  • RQ2最先端の再構成ベース手法と比較して、MIROのサンプル効率性および漸近的性能はどのように評価できるか?
  • RQ3環境に視覚的ノイズが含まれる場合、MIROおよび再構成ベースのモデルの性能は向上するか、悪化するか?
  • RQ4シーンにごみや不要な物体が存在する状況でも、MIROはタスクに必要なダイナミクスのみを捉える潜在空間を学習できるか?
  • RQ5潜在状態と将来の観測値の間の相互情報量を最大化することは、構造のない環境における計画性能の向上に寄与するか?

主な発見

  • MIROは、赤い球や緑の立方体といったランダムに配置された干渉要因が存在する状況でも性能を維持または向上させるが、PlaNetのような再構成ベースの手法は著しく劣化する。
  • チーター環境では、視覚的ノイズが増加するほどMIROの性能が向上し、干渉要因がタスクに必要な特徴に注目するのを助けることが示された。
  • カートポールバランス環境では、PlaNetは干渉要因下で効果的に学習できないが、MIROは安定的かつ成功した学習を達成した。
  • 干渉要因がない状況では、MIROはすべての4つのベンチマーク環境(カートポール、リーチャー、フィンガー、ハーフチーター)でPlaNetと同等またはそれ以上の漸近的性能を達成した。
  • NCEに基づく相互情報目的関数により、不要な視覚的詳細やノイズを除外するよりロバストな潜在空間が実現された。
  • 潜在表現と予測モデルの共同最適化により、現実世界に近い環境下で計画のロバスト性とサンプル効率性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。