Skip to main content
QUICK REVIEW

[論文レビュー] VPE: Variational Policy Embedding for Transfer Reinforcement Learning

Isac Arnekvist, Danica Kragić|arXiv (Cornell University)|Sep 10, 2018
Reinforcement Learning in Robotics被引用数 3
ひとこと要約

本稿では、類似したマルコフ決定過程(MDP)の族にまたがる教師方策からQ関数の低次元潜在空間を学習する、転移強化学習のための変分方策埋め込み(VPE)を提案する。変分推論とベイズ最適化を用いてこの潜在空間における方策適応を最適化することで、VPEは新しい環境への高速かつデータ効率の良い適応を可能にし、シミュレーションおよび実世界のロボット押し出しタスクにおいて、わずか5〜10分の実世界ロールアウトで実証された。

ABSTRACT

Reinforcement Learning methods are capable of solving complex problems, but resulting policies might perform poorly in environments that are even slightly different. In robotics especially, training and deployment conditions often vary and data collection is expensive, making retraining undesirable. Simulation training allows for feasible training times, but on the other hand suffers from a reality-gap when applied in real-world settings. This raises the need of efficient adaptation of policies acting in new environments. We consider this as a problem of transferring knowledge within a family of similar Markov decision processes. For this purpose we assume that Q-functions are generated by some low-dimensional latent variable. Given such a Q-function, we can find a master policy that can adapt given different values of this latent variable. Our method learns both the generative mapping and an approximate posterior of the latent variables, enabling identification of policies for new tasks by searching only in the latent space, rather than the space of all policies. The low-dimensional space, and master policy found by our method enables policies to quickly adapt to new environments. We demonstrate the method on both a pendulum swing-up task in simulation, and for simulation-to-real transfer on a pushing task.

研究の動機と目的

  • 強化学習における方策の一般化性能の低さ、特にデータ収集が高コストなロボット分野において、わずかに異なる環境に方策を展開する際の課題に対処すること。
  • 完全な再トレーニングなしに、類似した環境の族内の新しいMDPに方策を効率的に適応させること。
  • 環境の変動を捉える、コンactな分離された潜在表現としての最適方策の学習。
  • 全方策空間ではなく、潜在空間におけるグローバル最適化を通じて、高速な方策適応を可能にすること。
  • 一貫した変分推論フレームワークを用いて、確率的および決定的両方の教師方策からの転送を可能にすること。

提案手法

  • 本手法は、MDPの族を低次元の潜在変数zによってパラメータ化し、深層生成モデルを介してzからQ関数を生成する。
  • エビデンス下限(ELBO)を導出することで、エンドツーエンドトレーニングが可能な、zの事後分布を近似するための変分推論フレームワークを用いる。
  • マスターポリシーはzに条件付けられており、各zに対して期待報酬を最大化する行動を生成するよう訓練され、方策転送を可能にする。
  • 新しいMDPへの方策適応は、潜在空間におけるベイズ最適化または確率的勾配降下法によるzの最適化によって実現され、全方策再トレーニングを回避する。
  • 次元が意味のある環境パラメータ(例:質量、摩擦)に対応するように、意味のある環境パラメータを分離する潜在空間を学習し、SNR分析により検証された。
  • 一貫した変分目的関数により、決定的および確率的両方の教師方策からの統合的転送が可能である。

実験結果

リサーチクエスチョン

  • RQ1類似した環境の族にまたがるMDPの変動を捉える低次元潜在空間を学習できるか?
  • RQ2この潜在空間に一般化可能なマスターポリシーを訓練し、新しいMDPへの高速適応を可能にできるか?
  • RQ3潜在空間が、質量や摩擦といった意味のある環境パラメータを分離できており、解釈可能な方策適応を可能にするか?
  • RQ4最小限の実世界インタラクションで、シミュレーションから実世界のロボットタスクへの有効な転送を達成できるか?
  • RQ5高次元の状態/行動空間における直接的方策最適化と比較して、潜在空間最適化の性能はどのようにか?

主な発見

  • 振り子のスイングアップタスクでは、VPEは未観測のMDPに対してわずか3ステップの最適化で-121.5 ± 2.2の報酬を達成し、ベースライン手法を著しく上回った。
  • シミュレーションから実世界への押し出しタスクでは、潜在空間におけるベイズ最適化を用いて5〜10分の実世界ロールアウトで成功した方策転送を達成した。
  • 潜在空間は明確な分離性を示し、押し出しタスクにおいてSNRが最大の次元が回転オフセットパラメータx_rotを符号化していた。
  • 方策適応のための有効な探索空間を、全方策空間から低次元の潜在空間に縮小し、効率的な最適化を可能にした。
  • 変分推論フレームワークは事後分布を効果的に圧縮し、潜在変数が事前分布に近づくようにクラスタリングされたことから、効果的な圧縮と一般化が確認された。
  • 教師方策が環境の変動の限定的なセットでトレーニングされた場合でも、未観測のMDPに対して優れたゼロショット転送能力を示し、良好な一般化性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。