Skip to main content
QUICK REVIEW

[論文レビュー] Learning Efficient Representation for Intrinsic Motivation

Ruihan Zhao, Stas Tiomkin|arXiv (Cornell University)|Dec 4, 2019
Reinforcement Learning in Robotics参考文献 14被引用数 5
ひとこと要約

本論文は、高次元の視覚的環境において、コストの高いサンプリングに依存せずに、行動と将来の状態の間の相互情報量として定義されるエンパワーメントを効率的に推定するための新規手法を提案する。深層ニューラルネットワークを用いて構造的な潜在空間ダイナミクスモデルを学習し、情報理論の「ウォーター・フィリング」アルゴリズムを適用することで、正確なエンパワーメント計算が可能となり、倒立振子の安定化やトンネル内での安全なナビゲーションのための内発的動機付けが成功した。

ABSTRACT

Mutual Information between agent Actions and environment States (MIAS) quantifies the influence of agent on its environment. Recently, it was found that the maximization of MIAS can be used as an intrinsic motivation for artificial agents. In literature, the term empowerment is used to represent the maximum of MIAS at a certain state. While empowerment has been shown to solve a broad range of reinforcement learning problems, its calculation in arbitrary dynamics is a challenging problem because it relies on the estimation of mutual information. Existing approaches, which rely on sampling, are limited to low dimensional spaces, because high-confidence distribution-free lower bounds for mutual information require exponential number of samples. In this work, we develop a novel approach for the estimation of empowerment in unknown dynamics from visual observation only, without the need to sample for MIAS. The core idea is to represent the relation between action sequences and future states using a stochastic dynamic model in latent space with a specific form. This allows us to efficiently compute empowerment with the "Water-Filling" algorithm from information theory. We construct this embedding with deep neural networks trained on a sophisticated objective function. Our experimental results show that the designed embedding preserves information-theoretic properties of the original dynamics.

研究の動機と目的

  • 高次元で未知の環境における行動と状態の間の相互情報量の推定が計算的に非現実的であるという問題に取り組む。
  • エキスパートが提供する報酬関数を必要とせず、視覚的観測のみを用いて現実のロボットシステムにおける内発的動機付けを可能にする。
  • 元のダイナミクスの情報理論的性質を保持する表現学習フレームワークを構築し、エンパワーメント計算に適したものとする。
  • 非線形環境における安定化および安全なナビゲーションのための内発的学習の有効性を実証する。

提案手法

  • 最終状態が行動系列に対して線形となる潜在空間における確率的ダイナミクスモデルを学習し、効率的なエンパワーメント計算を可能にする。
  • 観測値と行動を、元のダイナミクスの情報理論的構造を保持する潜在空間に埋め込むためのカスタム目的関数を用いて深層ニューラルネットワークを訓練する。
  • 情報理論の「ウォーター・フィリング」アルゴリズムを適用し、潜在空間においてチャネル容量(エンパワーメント)を効率的に計算する。
  • 計算されたエンパワーメントを強化学習における方策学習を支援する内発的報酬信号として使用する。
  • 知覚、エンパワーメント推定、方策最適化を閉ループで統合するIMPAC(内発的動機付けによる知覚と行動サイクル)フレームワークを設計する。
  • 2つのドメインで手法を検証する:非線形倒立振子の安定化とダブルトンネル環境における安全なナビゲーション。

実験結果

リサーチクエスチョン

  • RQ1サンプリングに基づく相互情報量推定を用いずに、未知の環境における生の視覚的観測からエンパワーメントを効率的に推定できるか?
  • RQ2学習された潜在空間表現が、正確なエンパワーメント計算に必要な元のダイナミクスの情報理論的性質を保持しているか?
  • RQ3潜在空間で計算されたエンパワーメントが、倒立振子の安定化といった複雑な制御タスクの解決に意味のある内発的報酬として機能するか?
  • RQ4エンパワーメントに基づく内発的報酬が、ナビゲーションタスクにおいてより安全でより頑健な経路を選好するように導けるか?

主な発見

  • 提案手法は、倒立振子に対して解析的解と定性的に一致するエンパワーメントランドスケープを効果的に生成し、その正確性を検証した。
  • エージェントは、学習されたエンパワーメントのみを内発的報酬として用いて、倒立振子を真上位置に安定化させることに成功し、有効な内発的学習を示した。
  • ダブルトンネル環境では、狭いトンネルにおける制御効果の低下が正しくエンパワーメントランドスケープに反映されており、環境制約を適切に捉えていることを確認した。
  • 内発的報酬の重み(β)を増加させると、エージェントはより長いが安全な幅広いトンネルを通る傾向を示し、エンパワーメントが保守的で安全な行動を促進することがわかった。
  • 本手法はサンプリングを一切用いずに効率的なエンパワーメント推定を実現し、従来の手法が失敗する高次元の視覚的空間への応用を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。