Skip to main content
QUICK REVIEW

[論文レビュー] Efficient transfer learning and online adaptation with latent variable models for continuous control

Christian F. Perez, Felipe Petroski Such|arXiv (Cornell University)|Dec 8, 2018
Robot Manipulation and Learning参考文献 9被引用数 7
ひとこと要約

本論文は、連続制御タスクにおける効率的な転移学習とオンライン適応を可能にする、変分推論に基づく潜在変数モデルを提案している。環境間で共有されるダイナミクスを補助的潜在変数を通じて学習し、オンラインベイズ推論によりそれらを更新することで、少量のサンプルで高速かつ効率的な学習が可能となり、物理的パラメータが変化するような新規または動的変化する環境(例:質量や摩擦が変化するHalfCheetah)に対しても頑健な一般化が達成される。

ABSTRACT

Traditional model-based RL relies on hand-specified or learned models of transition dynamics of the environment. These methods are sample efficient and facilitate learning in the real world but fail to generalize to subtle variations in the underlying dynamics, e.g., due to differences in mass, friction, or actuators across robotic agents or across time. We propose using variational inference to learn an explicit latent representation of unknown environment properties that accelerates learning and facilitates generalization on novel environments at test time. We use Online Bayesian Inference of these learned latents to rapidly adapt online to changes in environments without retaining large replay buffers of recent data. Combined with a neural network ensemble that models dynamics and captures uncertainty over dynamics, our approach demonstrates positive transfer during training and online adaptation on the continuous control task HalfCheetah.

研究の動機と目的

  • 質量や摩擦などの未知の物理的パラメータの影響により環境ダイナミクスが変化する状況において、モデルベース強化学習の一般化性能が著しく低下するという課題に対処すること。
  • 環境固有の特性を共有する潜在表現として学習することで、共有ダイナミクスを持つ複数の環境間で高速かつデータ効率の良い学習を可能にすること。
  • 大規模な経験バッファを保持する必要がないように、オンラインベイズ推論を用いて推論中に動的変化する環境にリアルタイムで適応できること。
  • 関連する訓練環境からの転移を活用することで、潜在変数推論を用いて新規環境における一般化性能と性能を向上させること。

提案手法

  • 共有されたニューラルネットワークアンサンブルがダイナミクスをモデル化する階層的確率的モデルを採用し、補助的潜在変数 $\mathbf{e}_k$ が環境固有の物理的パラメータを表す。
  • 訓練中にダイナミクスモデルと未知の環境特性の潜在表現 $\mathbf{e}_k$ を同時に学習するため、変分推論を適用する。
  • 新しい遷移が順次到着するのを受けて、$\mathbf{e}_k$ の事後分布をオンラインで逐次更新することで、大規模なリプレイバッファの保持を回避する。
  • ダイナミクスの不確実性をディープニューラルネットワークアンサンブルでモデル化することで、単一モデルと比較してロバスト性が向上し、過学習が軽減される。
  • 環境固有の最小および最大平均報酬を用いて報酬をスケーリングし、異なる環境間での公平な比較を可能にする。
  • 事後分布が解析的に求められないため、効率的かつスケーラブルな推論を可能にするために、確率的変分推論を用いて $\mathbf{e}_k$ の事後分布を近似する。

実験結果

リサーチクエスチョン

  • RQ1物理的パラメータが異なる環境において、補助的潜在変数を備えた共有ダイナミクスモデルが、より高速かつ一般化性の高い学習を可能にするか?
  • RQ2学習済みの潜在変数に対するオンラインベイズ推論は、大規模なメモリオーバーヘッドなしに、動的変化する環境ダイナミクスへのリアルタイム適応をどの程度効果的にサポートできるか?
  • RQ3潜在変数学習に変分推論を用いることで、トレーニング中に正の転移が達成され、新規テスト環境での性能が向上するか?
  • RQ4データ効率性と一般化性能の観点から、本手法の性能はスペシャリスト型およびジェネリック型エージェントと比較してどの程度優れているか?
  • RQ5推論された潜在変数が、重力の角度 $\theta_g$ のような環境の真の物理的パラメータをどの程度正確に捉えているか?

主な発見

  • 提案手法は、物理的パラメータが異なる環境間で、スペシャリスト型およびジェネリック型ベースラインと比較してより高速な学習を達成しており、トレーニング中に正の転移が顕著に観察された。
  • 500ステップ目以降に $\theta_g$ が $-6^\circ$ から $6^\circ$ に変化する動的変化する環境において、本手法は大規模な経験バッファを保持しない一般istベースラインを、わずか5エピソードの学習で上回った。
  • 本手法は新規テスト環境に対しても効果的に一般化しており、推論された潜在変数は、訓練分布外であっても $\theta_g$ の相対的な順序を正確に捉え、外挿も可能であった。
  • 潜在変数表現は、訓練環境およびテスト環境において真の $\theta_g$ 値と整合するように学習された2次元潜在空間に整列しており、環境ダイナミクスに意味のある構造を捉えていることが示された。
  • 本手法は、最終的な性能を犠牲にすることなく、すべての環境で強力な性能を維持しており、ジェネリック型ベースラインが高データ環境下でわずかに優れている場合でも同様であった。
  • オンラインベイズ推論の使用により、大規模な経験バッファを保持する必要がなくなり、メモリ制約を軽減しながらも、ロバスト性を維持したリアルタイム適応が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。