Skip to main content
QUICK REVIEW

[論文レビュー] APS: Active Pretraining with Successor Features

Hao Liu, Pieter Abbeel|arXiv (Cornell University)|Aug 31, 2021
Reinforcement Learning in Robotics被引用数 12
ひとこと要約

APSは強化学習における非教師あり事前学習のための新規手法を提案する。変分的後続特徴を用いて、状態エントロピーの最大化と条件付きエントロピーの最小化を同時に実現することで、効率的な探索と迅速なタスク適応を可能にする。Atari 100kで評価した結果、データ効率および漸近的性能の両面で先行手法を上回り、最先端の性能を達成した。

ABSTRACT

We introduce a new unsupervised pretraining objective for reinforcement learning. During the unsupervised reward-free pretraining phase, the agent maximizes mutual information between tasks and states induced by the policy. Our key contribution is a novel lower bound of this intractable quantity. We show that by reinterpreting and combining variational successor features~\citep{Hansen2020Fast} with nonparametric entropy maximization~\citep{liu2021behavior}, the intractable mutual information can be efficiently optimized. The proposed method Active Pretraining with Successor Feature (APS) explores the environment via nonparametric entropy maximization, and the explored data can be efficiently leveraged to learn behavior by variational successor features. APS addresses the limitations of existing mutual information maximization based and entropy maximization based unsupervised RL, and combines the best of both worlds. When evaluated on the Atari 100k data-efficiency benchmark, our approach significantly outperforms previous methods combining unsupervised pretraining with task-specific finetuning.

研究の動機と目的

  • 既存の非教師あり事前学習手法の限界、特に相互情報に基づく手法における探索の悪さとエントロピーに基づく手法におけるタスク条件付けの欠如を解決すること。
  • 状態エントロピーの最大化とタスク条件付き行動学習を統合した包括的な事前学習目的を構築し、下流タスクの性能を向上させること。
  • 報酬なしの効率的な事前学習を可能とし、最小限の環境相互作用で下流タスクへのファインチューニングを迅速に行えるようにすること。
  • 非パrametricなエントロピー最大化と変分的後続特徴を組み合わせることで、Atariベンチマークで優れたデータ効率と性能が得られることを示すこと。

提案手法

  • 状態 s とタスク変数 z の間の相互情報 I(s;z) = H(s) - H(s|z) を事前学習目的として定式化し、探索とタスク固有の行動を促進する。
  • 非パrametricなエントロピー最大化(APTスタイル)を用いて、低次元の抽象表現空間で H(s) を最大化し、探索を促進する。
  • 計算不能な条件付きエントロピー H(s|z) の変分的下界を、後続特徴を用いて導入することで、効率的な最適化を可能にする。
  • 共有エンコーダーを介した共有表現学習を活用することで、データ効率と表現品質を向上させる。
  • 報酬なしのフェーズでエージェントを訓練し、エントロピー最大化による経験収集を実施し、その後、スパarsな報酬を持つ下流タスクでファインチューニングを行う。
  • 粒子ベースのエントロピー推定と後続特徴モデリングを組み合わせることで、探索とタスク固有スキルの発見のバランスを図る。

実験結果

リサーチクエスチョン

  • RQ1状態エントロピーの最大化とタスク条件付き行動学習を組み合わせることで、強化学習におけるデータ効率が向上するか?
  • RQ2条件付きエントロピー H(s|z) の変分的下界を用いることで、密度推定を必要とせずに効果的な事前学習が可能になるか?
  • RQ3APSはAPTおよびVISRと比較して、探索および下流タスクへの適応性において優れているか?
  • RQ4共有表現学習が事前学習フェーズの性能向上にどの程度寄与するか?

主な発見

  • APSはフルベンチマークの57ゲーム中15ゲームで人間を上回る性能を達成し、すべての先行手法が最大12ゲームにとどまったのに対し、最高の性能を記録した。
  • 26ゲームのAtari 100kサブセットでは、APSは人間正規化スコアで平均99.04、中央値58.80を達成し、先行の最先端手法を顕著に上回った。
  • アブレーションスタディの結果、APSはエントロピー最大化とタスク条件付けの両方を組み合わせた場合にAPTおよびVISRの変種を上回る性能を示し、相乗効果が得られていることが示された。
  • ファインチューニングを除去しても、強力なゼロショット性能(平均スコア81.41)を示し、VISRにファインチューニングを施した場合をも上回った。これは、事前学習そのものの価値を示している。
  • 共有エンコーダーを用いることでデータ効率が向上し、共有エンコーダーを排除したAPSでは平均スコア87.59にとどまるのに対し、完全な手法では99.04を記録した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。