Skip to main content
QUICK REVIEW

[論文レビュー] Learning One Representation to Optimize All Rewards

Abdelaziz Touati, Yann Ollivier|arXiv (Cornell University)|Mar 14, 2021
Reinforcement Learning in Robotics参考文献 18被引用数 5
ひとこと要約

本論文は、報酬フリーなMDPの学習可能でコンactな要約である前向き後向き(FB)表現を導入し、計画を経ずに任意の報酬に対して近似的に最適な方策を直接導出可能にする。非報酬に依存する経験に対してオフポリシー時系列差分学習を用いてF(前向き)およびB(後向き)の2つの深層表現を学習することで、訓練が完全な場合には理論的に最適な方策を達成でき、劣化度は近似誤差に比例する。

ABSTRACT

We introduce the forward-backward (FB) representation of the dynamics of a reward-free Markov decision process. It provides explicit near-optimal policies for any reward specified a posteriori. During an unsupervised phase, we use reward-free interactions with the environment to learn two representations via off-the-shelf deep learning methods and temporal difference (TD) learning. In the test phase, a reward representation is estimated either from observations or an explicit reward description (e.g., a target state). The optimal policy for that reward is directly obtained from these representations, with no planning. We assume access to an exploration scheme or replay buffer for the first phase. The corresponding unsupervised loss is well-principled: if training is perfect, the policies obtained are provably optimal for any reward function. With imperfect training, the sub-optimality is proportional to the unsupervised approximation error. The FB representation learns long-range relationships between states and actions, via a predictive occupancy map, without having to synthesize states as in model-based approaches. This is a step towards learning controllable agents in arbitrary black-box stochastic environments. This approach compares well to goal-oriented RL algorithms on discrete and continuous mazes, pixel-based MsPacman, and the FetchReach virtual robot arm. We also illustrate how the agent can immediately adapt to new tasks beyond goal-oriented RL.

研究の動機と目的

  • 将来の任意の報酬関数に対して最適な方策の導出を可能にする、環境の普遍的表現を1つのエージェントが学習すること。
  • ゴール指向の強化学習やモデルベースの計画の限界を克服するため、非報酬に依存する段階でコンパクトで汎用的な表現を学習すること。
  • 完全な訓練下で最適性を保証する、理論的裏付けのある非報酬学習目的関数を提供すること。
  • ゴール到達タスクを超えた一般化を示し、密度の高い複雑な報酬関数に対しても有効であること。
  • 再訓練や計画を経ずに、高次元かつ確率的な環境でも新しいタスクに即座に適応できること。

提案手法

  • F(s,a,z) および B(s',a') が状態行動ペアを潜在空間 Z ≈ R^d にマップする前向き後向き(FB)表現フレームワークを活用する。
  • 報酬関数 π_z における s から s' に到達する長期的占有確率を近似する時系列差分(TD)損失を用いて F および B を訓練する。
  • 方策は π_z(s) = argmax_a F(s,a,z)^T z として定義され、z および表現から直接方策を推論可能である。
  • 報酬表現 z は報酬観測または明示的な記述(例:ターゲット状態)から線形射影によって計算される。
  • トレーリングバッファを用いたオフザシェルの深層学習とオフポリシーTD学習を採用し、軌道合成やスパース報酬を回避する。
  • 訓練の安定化のためポリャック平均化を採用し、理論的最適性保証を持つ整合的な非報酬損失を採用する。

実験結果

リサーチクエスチョン

  • RQ1報酬フリーな経験から、任意の報酬関数に対して最適な方策の導出を可能にする、1つのコンパクトな表現を学習可能か?
  • RQ2F および B の非報酬学習を、理論的最適性保証を持つ整合的な損失関数としてどのように定式化できるか?
  • RQ3この手法は、ゴール到達タスクを超えて、複雑で密度の高い、あるいはマルチオブジェクティブな報酬に対してもどれほど一般化可能か?
  • RQ4サンプル効率および方策品質の観点で、ゴール指向の強化学習およびモデルベースのベースラインと比較してどのように差がつくか?
  • RQ5FB表現はどの程度の長距離の状態行動依存関係を学習し、一般化をどのように支援するか?

主な発見

  • 訓練が完全な場合、FB表現は理論的に最適な方策を達成でき、劣化度は非報酬近似誤差で上限が定まる。
  • 離散的および連続的マップにおいて、FBはDQNベースのゴール指向手法を成功確率およびサンプル効率の面で上回り、特に高次元表現(FB-100)では800エポックでDQNを上回る。
  • ピクセルベースのMs. Pacmanでは、禁止領域を避けることや報酬距離のバランスを取る複雑なタスクに対し、FBが的確な軌道を学習した。
  • FetchReachでは、1000個のサンプルされたゴールに対して平均90%以上の成功確率を達成し、連続制御におけるロバスト性を示した。
  • t-SNE可視化により、FB表現が環境の構造的特徴(例:部屋、サイクル、ドア)を回復していることが確認され、長距離の状態表現が有効であることが示された。
  • 本手法により、近隣の小さな報酬と遠くの大きな報酬の間で選択するような新しいタスクへの即時適応が可能となり、従来のゴール指向手法では再訓練なしには対応できないタスクに対しても有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。