Skip to main content
QUICK REVIEW

[論文レビュー] MURAL: Meta-Learning Uncertainty-Aware Rewards for Outcome-Driven Reinforcement Learning

Li, Kevin, Abhishek Gupta|arXiv (Cornell University)|Jul 15, 2021
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

MURALは、強化学習における結果指向の報酬を提供する不確実性に配慮した分類器を訓練するメタラーニング手法を提案する。正規化最大尤度(NML)推定をメタラーニングで活用することで、複雑なナビゲーションおよびロボット操作タスクにおいて、効果的な探索と指向性のあるポリシー学習を可能にし、困難な環境下でも先行手法を上回る性能を発揮する。

ABSTRACT

Exploration in reinforcement learning is a challenging problem: in the worst case, the agent must search for high-reward states that could be hidden anywhere in the state space. Can we define a more tractable class of RL problems, where the agent is provided with examples of successful outcomes? In this problem setting, the reward function can be obtained automatically by training a classifier to categorize states as successful or not. If trained properly, such a classifier can provide a well-shaped objective landscape that both promotes progress toward good states and provides a calibrated exploration bonus. In this work, we show that an uncertainty aware classifier can solve challenging reinforcement learning problems by both encouraging exploration and provided directed guidance towards positive outcomes. We propose a novel mechanism for obtaining these calibrated, uncertainty-aware classifiers based on an amortized technique for computing the normalized maximum likelihood (NML) distribution. To make this tractable, we propose a novel method for computing the NML distribution by using meta-learning. We show that the resulting algorithm has a number of intriguing connections to both count-based exploration methods and prior algorithms for learning reward functions, while also providing more effective guidance towards the goal. We demonstrate that our algorithm solves a number of challenging navigation and robotic manipulation tasks which prove difficult or impossible for prior methods.

研究の動機と目的

  • ユーザーが提供する成功事例を用いて、報酬が疎で探索が不十分な強化学習の課題に取り組むこと。
  • 手動での報酬設計を伴わずに、成功事例から形状の良い報酬信号を導出可能な、実行可能でスケーラブルな手法を開発すること。
  • 不確実性推定を報酬関数に組み込むことで、探索を向上させ、未知で有望な状態へと誘導すること。
  • ロボット操作やナビゲーションのような高次元で連続的な制御タスクにおいて、効果的な学習を可能にすること。
  • 正規化最大尤度(NML)推定を用いて理論的根拠があり、キャリブレーションされた報酬信号を提供すること。

提案手法

  • GANに類似した敵対的目的を用いて、ユーザーが提供する成功状態と現在のポリシーが訪れた状態を区別する二値分類器を訓練する。
  • メタラーニングフレームワークを用いて、分類器の予測に対するキャリブレーションされた不確実性推定を効率的に推定する正規化最大尤度(NML)分布を推定する。
  • 分類器の予測の不確実性を探索ボーナスとして組み込み、モデルが不確信している状態へとエージェントが向かうように誘導する。
  • 分類器の予測成功確率とその不確実性を組み合わせて、指導と探索のバランスが取れた複合報酬信号を形成する。
  • 一般化とロバストネスを向上させるために、データオーグメンテーション(例:mixup)と重み減衰を用いる。
  • 成功状態と失敗状態のサポートセット上でNML損失を最小化するメタ最適化プロセスを用いて分類器を更新する。

実験結果

リサーチクエスチョン

  • RQ1成功事例で訓練された分類器は、探索を向上させる形状の良い不確実性に配慮した報酬信号を提供できるか?
  • RQ2NMLによる不確実性推定は、標準的な分類器ベースの報酬設計と比較して、サンプル効率と最終的なパフォーマンスをどのように向上させるか?
  • RQ3メタラーニングは、高次元で連続的な制御設定におけるNMLに基づく不確実性推定の計算を実行可能にするか?
  • RQ4提案手法は、カウンティングベースの探索や先行の分類器ベースの報酬学習手法と比較して、複雑なロボットタスクで優れているか?
  • RQ5この手法は、多様なナビゲーションおよび操作環境にどれほど一般化できるか?

主な発見

  • MURALは、Sawyerドア開閉、デキストラスハンド再配置、アンチロケーションなど、先行手法が失敗する困難なロボット操作およびナビゲーションタスクを成功に解決した。
  • 評価されたすべての環境において、VICE、RND、および標準的な分類器ベースのRLベースラインと比較して、より高いサンプル効率と最終パフォーマンスを達成した。
  • 不確実性に配慮した報酬信号により、探索がより指向的になり、ゴール状態に到達するまでの時間が、カウンティングベースや不確実性に配慮しない手法と比較して短縮された。
  • メタラーニングで学習されたNML推定により、明示的な密度推定を必要とせず、高次元の観測に対しても正確な不確実性評価が可能となり、スケーラビリティが確保された。
  • アブレーションスタディの結果、不確実性推定やメタラーニングの除去により性能が著しく低下することが確認され、両者の必要性が裏付けられた。
  • この手法は、報酬が疎く動的が複雑な環境を含む多様なタスクに良好に一般化でき、環境の変動に対してもロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。