Skip to main content
QUICK REVIEW

[論文レビュー] Dimension-Wise Importance Sampling Weight Clipping for Sample-Efficient Reinforcement Learning

Seungyul Han, Youngchul Sung|arXiv (Cornell University)|May 7, 2019
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本論文は、行動次元ごとに重要度サンプリング重みをクリッピングすることで勾配の消失やバイアスを低減し、勾配の流れを改善する、サンプル効率の高い強化学習アルゴリズムである次元別重要度サンプリング重みクリッピング(DISC)を提案する。DISCは、一般化された便宜的推定(GAE-V)と組み合わせることで、非同期データの有効な再利用を可能にし、OpenAI Gym環境における高次元連続制御タスクで顕著な性能向上を達成し、HumanoidStandupを含む6つのベンチマークのうち5つで最先端の結果を達成した。

ABSTRACT

In importance sampling (IS)-based reinforcement learning algorithms such as Proximal Policy Optimization (PPO), IS weights are typically clipped to avoid large variance in learning. However, policy update from clipped statistics induces large bias in tasks with high action dimensions, and bias from clipping makes it difficult to reuse old samples with large IS weights. In this paper, we consider PPO, a representative on-policy algorithm, and propose its improvement by dimension-wise IS weight clipping which separately clips the IS weight of each action dimension to avoid large bias and adaptively controls the IS weight to bound policy update from the current policy. This new technique enables efficient learning for high action-dimensional tasks and reusing of old samples like in off-policy learning to increase the sample efficiency. Numerical results show that the proposed new algorithm outperforms PPO and other RL algorithms in various Open AI Gym tasks.

研究の動機と目的

  • PPOのようなオンポリシーなアルゴリズムを用いた高行動次元の連続制御タスクにおけるサンプル非効率性を解消すること。
  • PPOにおけるグローバルな重要度サンプリング重みクリッピングによって引き起こされるバイアスと勾配の消失を低減すること。
  • オンポリシー学習フレームワークにおいて非同期データを効果的に再利用し、サンプル効率を向上させること。
  • 環境に依存しないハイパーパrameterチューニングを必要とせず、安定的かつスケーラブルに性能を維持できる手法を開発すること。

提案手法

  • 行動次元ごとの重要度サンプリング(IS)重みクリッピングを提案し、全体の尤度比ではなく、各行動次元のIS重みを個別にクリッピングする。
  • クリッピングされない次元が学習に寄与できるように、修正されたポリシー更新を導入することで勾配信号を保持し、バイアスを低減し、完全な勾配の消失を回避する。
  • 一般化された便宜的推定(GAE)とV-traceを組み合わせたGAE-Vを用いて、非同期軌道からの便宜的推定を実施し、古いデータに対しても安定した価値推定を可能にする。
  • オンポリシーデータを現在のポリシー更新に使用すると同時に、前回の反復から得た非同期データバッチを再利用するハイブリッドトレーニング戦略を採用し、データ効率を向上させる。
  • クリッピングされたIS重みを用いた経験的リスク最小化により、ポリシー更新のバウンディングを実現し、学習の安定性を確保する。
  • PPOの目的関数を次元別クリッピングを組み込む形で変更し、信頼領域に類似した挙動を維持しながら勾配の流れを強化する。

実験結果

リサーチクエスチョン

  • RQ1標準的なPPOと比較して、高次元行動空間において次元別IS重みクリッピングはバイアスと勾配の消失をどれほど低減できるか?
  • RQ2安定性を損なわずに、PPOのようなオンポリシーRLフレームワークにおいて非同期データをどの程度効果的に再利用できるか?
  • RQ3GAEとV-traceを組み合わせたGAE-Vは、オンポリシーアルゴリズムの非同期軌道において、正確な便宜的推定を可能にするか?
  • RQ4高次元Mujocoタスクにおいて、提案されたDISCアルゴリズムは、最先端のオンポリシーおよびオフポリシーRLアルゴリズムと比較して、どの程度のサンプル効率と最終的パフォーマンスを達成するか?

主な発見

  • DISCはMujocoベンチマークタスクの6つ中5つで最高の平均報酬を達成し、17個の行動次元を持つHumanoidStandupでも同様に優れた結果を示した。
  • HumanoidStandup環境では、DISCが最大で平均報酬246,435.89を達成し、次に優れた手法(Trust-PCL)の139,513.04を大きく上回った。
  • SAC、TD3、DDPGなどの他の最先端のアルゴリズムと比較しても、DISCは多様な連続制御タスクで一貫して優れた性能を示した。
  • 最小限のハイパーパrameterチューニングで安定した性能を示し、ロバストネスと一般化能力の高さを示した。
  • 学習曲線は、標準的なPPOが性能を発揮できない高次元設定でも、安定的かつサンプル効率の高い学習を示した。
  • アブレーションスタディの結果、次元別クリッピングとGAE-Vの両方がDISCの優れた性能を支える上で不可欠な要素であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。