Skip to main content
QUICK REVIEW

[論文レビュー] Universal Successor Features for Transfer Reinforcement Learning

Chen Ma, Dylan R. Ashley|arXiv (Cornell University)|Jan 5, 2020
Reinforcement Learning in Robotics参考文献 18被引用数 11
ひとこと要約

本稿では強化学習における転移可能な知識表現として、普遍的後続表現(USR)を提案する。これは目的にわたる後続表現を一般化することで、新しいタスクへの迅速な適応を可能にする。目的を条件として後続特徴を予測する深層ニューラルネットワークを訓練することで、USRはランダム初期化よりも著しく高速に方策学習を開始でき、グリッドワールド環境における未学習の目的において優れたゼロショット転移性能を達成する。

ABSTRACT

Transfer in Reinforcement Learning (RL) refers to the idea of applying knowledge gained from previous tasks to solving related tasks. Learning a universal value function (Schaul et al., 2015), which generalizes over goals and states, has previously been shown to be useful for transfer. However, successor features are believed to be more suitable than values for transfer (Dayan, 1993; Barreto et al.,2017), even though they cannot directly generalize to new goals. In this paper, we propose (1) Universal Successor Features (USFs) to capture the underlying dynamics of the environment while allowing generalization to unseen goals and (2) a flexible end-to-end model of USFs that can be trained by interacting with the environment. We show that learning USFs is compatible with any RL algorithm that learns state values using a temporal difference method. Our experiments in a simple gridworld and with two MuJoCo environments show that USFs can greatly accelerate training when learning multiple tasks and can effectively transfer knowledge to new tasks.

研究の動機と目的

  • 目的や報酬関数が異なる多様な強化学習タスク間での知識転移の課題に対処すること。
  • 動的特性と報酬関数の両方の一般化に苦労する普遍的価値関数の限界を克服すること。
  • 遷移ダイナミクスのみに一般化する後続表現フレームワークを構築し、より安定的かつ効果的な転移を可能にすること。
  • オフポリシー経験を用いて、USRをエンドツーエンドで近似するための深層学習アーキテクチャを設計すること。
  • USR初期化がランダム初期化と比較して、新しいタスクにおける収束をより速く達成できることを実証すること。

提案手法

  • 報酬関数を状態-行動-状態特徴と重みベクトルの線形結合に分解する:$ r(s_t,a_t,s_{t+1}) = \mathbf{\phi}(s_t,a_t,s_{t+1})^\top \mathbf{w} $。
  • 方針に従う状態における特徴の割合割合の期待値として、後続表現$ \mathbf{\psi}^\pi(s, \text{goal}) $を定義する。
  • 時間差分損失を用いて、深層ニューラルネットワークが$ \mathbf{\psi}(s, g; \theta_\psi) $を予測するように訓練する:$ L_\psi = \| \mathbf{\phi}(s_t) + \gamma_t \mathbf{\psi}(s_{t+1}, g; \theta_\psi) - \mathbf{\psi}(s_t, g; \theta_\psi) \|_2^2 $。
  • 報酬予測誤差に基づいて勾配降下法を用いて、報酬重みベクトル$ \mathbf{w}(g; \theta_w) $を同時に訓練する:$ L_w = [r_t - \mathbf{\phi}(s_{t+1})^\top \mathbf{w}(g; \theta_w)]^2 $。
  • 予測された後続特徴と報酬重みを用いて、アクター・クリティック更新による方策改善のためのアドバンテージ信号を計算する。
  • 事前に未学習のターゲット目的を学習する方策を初期化する前に、ソース目的の集合でUSRモデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1後続表現を目的にわたって一般化することで、強化学習における効果的な転移学習が可能になるか?
  • RQ2動的特性のみに一般化する普遍的後続表現を訓練することで、普遍的価値関数と比較してより優れた転移性能が得られるか?
  • RQ3一部の目的で訓練されたUSRモデルが、未学習の新しい目的における学習を、ランダム方策初期化と比較してより速く可能にするか?
  • RQ4生のピクセル観測を持つ視覚的グリッドワールド環境において、USRは目的にわたってどれほど一般化するか?
  • RQ5USRベースの初期化は、下流の方策学習におけるサンプル複雑性をどの程度低減するか?

主な発見

  • USRモデルは、目的にわたる後続表現を効果的に一般化し、4ルームグリッドワールド環境における未学習のターゲット目的へのゼロショット転移を可能にした。
  • 64つの目的のうち48つの目的での訓練に限ってUSRを学習したエージェントは、残りの16つの未学習の目的において、ランダム初期化と比較して著しく高速に学習を達成した。
  • USRモデルは未学習の目的において強力な一般化性能を示し、方策学習の収束が速く、サンプル効率も向上した。
  • 報酬特徴と後続表現の共同最適化を用いた提案された訓練アルゴリズムは、安定的かつ効果的な方策学習を達成した。
  • USRをインダクティブバイアスとして用いることで、新しいタスクへの適応が著しく速くなった。これは、USRが強化学習における転移可能な知識表現としての価値を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。