Skip to main content
QUICK REVIEW

[論文レビュー] Offline Meta Reinforcement Learning.

Ron Dorfman, Aviv Tamar|arXiv (Cornell University)|Aug 6, 2020
Reinforcement Learning in Robotics被引用数 7
ひとこと要約

この論文は、N個の事前学習済み強化学習エージェントから得たオフラインデータを活用して、新しい未確認のタスクへの迅速な適応を可能にするベイズ最適方策を学習する、オフラインメタ強化学習(OMRL)を提案する。深層ニューラルネットワークを用いてVariBADをオフポリシー設定に拡張することで、サンプル効率の高いメタ強化学習学習が実現され、オンラインメタ強化学習設定において従来手法を顕著に上回る性能を発揮する。

ABSTRACT

Consider the following problem, which we term Offline Meta Reinforcement Learning (OMRL): given the complete training histories of $N$ conventional RL agents, trained on $N$ different tasks, design a learning agent that can quickly maximize reward in a new, unseen task from the same task distribution. In particular, while each conventional RL agent explored and exploited its own different task, the OMRL agent must identify regularities in the data that lead to effective exploration/exploitation in the unseen task. To solve OMRL, we take a Bayesian RL (BRL) view, and seek to learn a Bayes-optimal policy from the offline data. We extend the recently proposed VariBAD BRL algorithm to the off-policy setting, and demonstrate learning of Bayes-optimal exploration strategies from offline data using deep neural networks. Furthermore, when applied to the online meta-RL setting (agent simultaneously collects data and improves its meta-RL policy), our method is significantly more sample efficient than the conventional VariBAD.

研究の動機と目的

  • 事前学習済みの強化学習エージェントからのみオフラインデータを用いて、新しい未確認のタスクへの迅速な適応を達成する挑戦に取り組む。
  • オンライン相互作用を伴わずに、多様なタスク間の共通する正則性を同定できるメタ強化学習エージェントを開発する。
  • 深層ニューラルネットワークを用いて、ベイズ強化学習(BRL)をオフラインでオフポリシーな設定に拡張する。
  • メタ方策の事前学習にオフラインデータを活用することで、オンラインメタ強化学習におけるサンプル効率を向上させる。

提案手法

  • N個の異なるタスクから収集されたオフラインデータからベイズ最適方策を学ぶために、ベイズ強化学習(BRL)の視点を採用する。
  • VariBADアルゴリズムをオフポリシー設定に拡張し、静的で相互作用のないデータセットから効果的に学習可能にする。
  • 深層ニューラルネットワークを用いて方策と価値関数の事後分布を表現することで、高次元の状態-行動空間におけるスケーラブルな推論を可能にする。
  • メタ方策をオフラインのデモンストレーションを用いて学習し、タスク間で共通する探索と報酬獲得戦略を捉える。
  • オフラインデータの構造を活用して、迅速な適応を可能にする一般化可能なインダクティブバイアスを推論する。
  • 推論時に追加の環境相互作用を必要とせず、新しいタスクにそのメタ方策を適用する。

実験結果

リサーチクエスチョン

  • RQ1メタ強化学習エージェントは、事前学習済みエージェントからのみオフラインデータを用いて、タスク間の一般化を達成できるか?
  • RQ2メタ強化学習設定において、静的でオフポリシーなデータセットからベイズ最適方策をどれほど正確に近似できるか?
  • RQ3オフラインデータを用いた事前学習は、標準的手法と比較してオンラインメタ強化学習におけるサンプル効率を向上させるか?
  • RQ4オフラインデータからどのようなインダクティブバイアスを発見することで、未確認のタスクにおける効果的な探索を支援できるか?
  • RQ5サンプル効率の観点から、本手法はオンラインメタ強化学習のベースラインと比較してどのように差をつけるか?

主な発見

  • 提案されたOMRL手法は、深層ニューラルネットワークを用いてオフラインデータからベイズ最適探索戦略を効果的に学習した。
  • 本手法はオンラインメタ強化学習において顕著なサンプル効率の向上を達成し、オンライン設定で適用した従来のVariBADを上回った。
  • オフラインデータを活用することで、推論時に追加の環境相互作用を必要とせずに、新しい未確認のタスクへも効果的に一般化できた。
  • VariBADをオフポリシー設定に拡張することで、静的データセットからの安定的かつ効果的な学習が可能になった。
  • 本手法は、トレーニング時に観測されていなかった新しいタスクに対しても、迅速な適応を可能にするタスク間の共通する正則性を同定した。
  • 本手法は、複数の強化学習エージェントからのオフラインデータを効果的に統合し、1つのメタ方策に抽出することで、高速で一般化可能な学習が可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。