[論文レビュー] Imagined Value Gradients: Model-Based Policy Optimization with Transferable Latent Dynamics Models
本論文では、視覚的およびプロ prioceptive観測から将来の報酬と価値を予測するために、移植可能な潜在動的モデルを用いるモデルベース強化学習手法である想像価値勾配(IVG)を提案する。想像された軌道の勾配を用いて方策を最適化することで、IVGはデータ効率が高く、新しい報酬や干渉要因を伴うタスクにおいて顕著な転移性能を達成し、サンプル効率においてモデルフリーのベースラインを上回る。
Humans are masters at quickly learning many complex tasks, relying on an approximate understanding of the dynamics of their environments. In much the same way, we would like our learning agents to quickly adapt to new tasks. In this paper, we explore how model-based Reinforcement Learning (RL) can facilitate transfer to new tasks. We develop an algorithm that learns an action-conditional, predictive model of expected future observations, rewards and values from which a policy can be derived by following the gradient of the estimated value along imagined trajectories. We show how robust policy optimization can be achieved in robot manipulation tasks even with approximate models that are learned directly from vision and proprioception. We evaluate the efficacy of our approach in a transfer learning scenario, re-using previously learned models on tasks with different reward structures and visual distractors, and show a significant improvement in learning speed compared to strong off-policy baselines. Videos with results can be found at https://sites.google.com/view/ivg-corl19
研究の動機と目的
- 一般用途の動的モデルを学習することで、視覚ベースの強化学習におけるサンプル効率と転移性を向上させること。
- 近似モデルでさえも、想像された軌道からの価値勾配を用いて、安定した方策最適化を実現すること。
- 事前学習済みの潜在動的モデルを、異なる報酬構造や視覚的干渉要因を伴う新しいタスクに転移すること。
- マルチタスクでの事前学習が、未学習のタスクにおける一般化性能と学習速度を向上させることを示すこと。
提案手法
- 本手法は、エンコーダ、遷移、デコーダネットワークを用いて、想像価値勾配(IVG)を用いて訓練された確率的かつ行動条件付きの潜在動的モデルを学習する。
- 価値関数の推定を微分可能にする方法を用い、潜在モデルの想像されたロールアウトを逆伝播することで方策勾配を計算する。
- 予測された将来の価値から導かれる価値勾配を用いて方策を最適化し、実環境のロールアウトに依存せずにエンドツーエンドの訓練を可能にする。
- 転移学習のため、エンコーダ、遷移、デコーダは事前学習済み重みで初期化された上で、新しいタスクでファインチューニングされ、方策および価値ヘッドは再びからすくいから訓練される。
- 価値関数学習および環境との相互作用の際、行動最適化に交差エントロピー法(CEM)を用い、誤差蓄積を抑えるために短いロールアウト(N=5)を採用する。
- 実環境の相互作用と想像されたロールアウトの両方を用いてモデルを訓練し、将来のリターンの微分可能なモデルベース予測により価値関数を推定する。
実験結果
リサーチクエスチョン
- RQ1モデルベース強化学習アプローチは、高次元の視覚的制御タスクにおいて、安定的かつデータ効率的な方策学習を達成できるか?
- RQ21つの学習済み潜在動的モデルは、異なる報酬関数や視覚的干渉要因を伴う新しいタスクに効果的に転移可能か?
- RQ3複数のソースタスクでの事前学習が、新しいターゲットタスクにおける一般化性能と学習速度を向上させるか?
- RQ4近似モデルからのみの想像されたロールアウトを用いても、安定した方策最適化が達成可能か?
主な発見
- IVGは、持ち上げや積み上げなどの視覚ベースの操作タスクにおいて、強力なモデルフリーのベースラインと同等の漸近的性能を達成する。
- 特に低データ環境下において、オフポリシーのモデルフリーのベースラインと比較して、本手法は顕著にデータ効率が向上する。
- 事前学習済みの潜在モデルを用いた転移学習は、新しいタスクにおける学習速度を劇的に向上させる。特に、複数のタスクで事前学習されたソースモデルの場合に顕著である。
- オープンループでの画像およびプロ prioceptive再構成は、30〜45ステップにわたり、訓練期間を越えてさえも一貫性を保つ。これは、潜在動的モデルの強固さを示している。
- 画像再構成がぼやけているにもかかわらず、潜在空間は高レベルのタスク関連特徴を捉えており、効果的な制御を可能にする。
- 動的モデルのマルチタスク事前学習は、個別に学習する場合よりも、未学習のタスクにおける収束速度の向上と一般化性能の向上をもたらす。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。