Skip to main content
QUICK REVIEW

[論文レビュー] Simplifying Deep Reinforcement Learning via Self-Supervision

Daochen Zha, Kwei-Herng Lai|arXiv (Cornell University)|Jun 10, 2021
Reinforcement Learning in Robotics参考文献 45被引用数 12
ひとこと要約

本稿では、自己ラベル化された高報酬トラジェクトリに基づく教師あり回帰のみを用いて、深層強化学習エージェントを訓練する単純なアルゴリズムである自己教師型強化学習(SSRL)を提案する。反復的に最高報酬を得たエピソードを収集し、それらを教師あり学習で模倣することで、方策勾配や価値ネットワークを一切使用せずに、安定的かつサンプル効率の良い方策改善を達成する。この方法は、多様な環境においてPPOやDQNと同等またはそれ以上の訓練の安定性と速度を達成する。

ABSTRACT

Supervised regression to demonstrations has been demonstrated to be a stable way to train deep policy networks. We are motivated to study how we can take full advantage of supervised loss functions for stably training deep reinforcement learning agents. This is a challenging task because it is unclear how the training data could be collected to enable policy improvement. In this work, we propose Self-Supervised Reinforcement Learning (SSRL), a simple algorithm that optimizes policies with purely supervised losses. We demonstrate that, without policy gradient or value estimation, an iterative procedure of ``labeling" data and supervised regression is sufficient to drive stable policy improvement. By selecting and imitating trajectories with high episodic rewards, SSRL is surprisingly competitive to contemporary algorithms with more stable performance and less running time, showing the potential of solving reinforcement learning with supervised learning techniques. The code is available at https://github.com/daochenzha/SSRL

研究の動機と目的

  • 深層強化学習の不安定さと高い分散を、教師あり学習手法の安定性を活用することで解消すること。
  • 教師あり学習の損失関数のみで、安定的かつ効果的な方策改善が可能かどうかを調査すること。
  • トレーニング中に専門家データが利用できない状況下で、高品質なデモンストレーションを特定する課題を克服すること。
  • 複雑な方策ベースまたは価値ベースの深層RLアルゴリズムの代替として、単純でスケーラブルかつ効率的な手法を開発すること。

提案手法

  • SSRLは反復的な2段階プロセスを用いる:(1) 現在の方策からロールアウトを収集し、エピソード収益に基づいて上位のパフォーマンスを示すトラジェクトリを選別する。そして(2) 選別された高報酬トラジェクトリに基づいて、教師あり回帰により新しい方策を学習する。
  • アルゴリズムは最高パフォーマンスを示したエピソードを「デモンストレーション」として扱い、価値関数や方策勾配信号を一切使用せずに、それらを模倣する教師あり学習を実行する。
  • ランク付けバッファは過去の高報酬トラジェクトリを保存・再利用することで、サンプル効率を向上させるとともに、学習の安定性を高める。
  • この手法はオフポリシーで動作し、過去のポリシーのバージョンから収集されたデータを新しいポリシーの訓練に活用できる。
  • 累積報酬が最も高いトラジェクトリを特定・優先順位付けするための単純なランク付けベースの選別メカニズムに依存する。
  • 方策ネットワークは、選別されたトラジェクトリからの状態-行動ペアに対して、標準的な教師あり回帰損失(例:平均二乗誤差)を用いて学習する。

実験結果

リサーチクエスチョン

  • RQ1方策勾配や価値推定を一切使用しない完全な教師あり学習アプローチが、強化学習において安定的かつ効果的な方策改善を達成できるか。
  • RQ2専門家デモンストレーションが利用できない状況下で、高品質なデモンストレーションを自動的に特定し、方策学習に活用する方法は何か。
  • RQ3自己教師学習によって反復的にデモンストレーションのセットを精錬することで、方策改善が単調に進行するか。
  • RQ4この自己教師型アプローチは、PPO や DQN といった確立されたモデルフリー強化学習アルゴリズムと同等またはそれ以上のサンプル効率と訓練の安定性を達成できるか。

主な発見

  • SSRLはトレーニング中にほぼ単調な方策改善を達成しており、標準的な深層RLアルゴリズムに比べて顕著な安定性を示している。
  • Atari Pongのような環境では、SSRLはPPO や DQN と同等またはそれ以上のパフォーマンスを達成しながら、はるかに少ない実行時間で学習を完了する。
  • 離散的および連続的制御タスクの両方、高次元の画像入力を含む環境においても、競争力のあるサンプル効率と安定した学習を示している。
  • 報酬が疎な環境(ハードな探索領域)では、カウントベース探索を用いたSSRLは目的に到達する一方で、A2Cは失敗しており、この手法の報酬が疎な状況下での強靭性を示している。
  • 計算負荷が軽く、実装が容易であり、最小限のハイパーパramータチューニングで十分に動作し、価値関数推定も不要である。
  • 理論的分析により、決定的MDPにおいてSSRLが方策改善を保証することが示されており、その実験的成功の形式的根拠が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。