Skip to main content
QUICK REVIEW

[論文レビュー] Fast Efficient Hyperparameter Tuning for Policy Gradients

Supratik Paul, Vitaly Kurin|arXiv (Cornell University)|Feb 18, 2019
Machine Learning and Data Classification参考文献 51被引用数 14
ひとこと要約

本稿では、オフポリシー重要度サンプリングを用いて、1回の学習実行中に、学習率やGAEパラメータなどの主要なポリシー勾配ハイパーパrameterを動的にチューニングする、サンプルおよび計算的に効率的な手法である、ハイパーパramータ最適化オンザフライ(HOOF)を提案する。HOOFはグリッドサーチや固定ハイパーパramータベースラインを上回り、追加の環境インタラクションを必要とせず、より速い学習と優れた性能を達成する。

ABSTRACT

The performance of policy gradient methods is sensitive to hyperparameter settings that must be tuned for any new application. Widely used grid search methods for tuning hyperparameters are sample inefficient and computationally expensive. More advanced methods like Population Based Training that learn optimal schedules for hyperparameters instead of fixed settings can yield better results, but are also sample inefficient and computationally expensive. In this paper, we propose Hyperparameter Optimisation on the Fly (HOOF), a gradient-free algorithm that requires no more than one training run to automatically adapt the hyperparameter that affect the policy update directly through the gradient. The main idea is to use existing trajectories sampled by the policy gradient method to optimise a one-step improvement objective, yielding a sample and computationally efficient algorithm that is easy to implement. Our experimental results across multiple domains and algorithms show that using HOOF to learn these hyperparameter schedules leads to faster learning with improved performance.

研究の動機と目的

  • 強化学習における既存のハイパーパラメータチューニング手法の高いサンプルおよび計算コストを低減すること。
  • 非定常な強化学習設定においてしばしば最適でない固定値ではなく、動的ハイパーパラメータスケジュールを学習する手法を開発すること。
  • 複数回の環境インタラクションを必要とせず、1回の学習実行からのデータのみを用いて効果的なハイパーパラメータ最適化を達成すること。
  • 行動ポリシーと評価ポリシーが乖離する場合でも、高い分散にさらされがちなオフポリシー価値推定の安定性と信頼性を保証すること。
  • 1次勾配法における重要度サンプリング推定を安定化させるために、単純なKL制約が十分であることを示すこと。これにより、複雑な2次勾配法の必要性がなくなる。

提案手法

  • HOOFは、ポリシー勾配法で得られた既存のトラジェクトリを用いて、異なるハイパーパラメータ設定(例:学習率、γ、λ)を持つ候補ポリシーを生成する。
  • 同じデータを現在のポリシーが収集したものに基づき、重み付き重要度サンプリング(WIS)を用いたオフポリシー評価を適用し、各候補ポリシーのリターンを推定する。
  • グリーディに、推定リターンが最大の候補ポリシーにポリシーを更新することで、動的ハイパーパラメータスケジュールを学習する。
  • 重要度サンプリング推定の安定性と情報性を保つために、KLダイバージェンス制約を適用する。
  • アルゴリズムは1回の学習実行で動作し、すべての環境インタラクションを再利用する。標準のポリシー勾配法に追加でハイパーパラメータを必要としない。
  • 本手法は一般性を有し、A2C、TNPG、TRPOなどのさまざまなポリシー勾配アルゴリズムに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1追加の環境インタラクションを必要とせず、1回の学習実行内でハイパーパラメータチューニングを効率的に行うことは可能か?
  • RQ2単純なKL制約のみで、1次勾配法におけるオフポリシー重要度サンプリングを安定化させることは可能か?
  • RQ3学習率やGAEパラメータなどのハイパーパラメータを動的に適応させることで、固定値設定よりも速い学習と優れた性能が得られるか?
  • RQ4サンプル効率および最終的性能の観点で、HOOFはグリッドサーチや他のハイパーパラメータ最適化ベースラインと比べてどのように差をつけるか?
  • RQ5提案手法は、最適化手法の変更(例:RMSProp対SGD)に対してロバストであるか?

主な発見

  • HOOFは、同じ数の学習実行回数でもグリッドサーチを上回る性能を達成し、その性能に到達するにはHOOFの10倍以上のサンプルが必要である。
  • HalfCheetah、Hopper、Ant、Walkerなどの環境において、A2C や TRPO などの固定ハイパーパラメータベースラインを著しく上回る。
  • TNPG設定では、HOOF-TNPGはより速く学習し、全テスト環境でデフォルトハイパーパラメータを用いたTRPOと同等またはそれを上回る性能を達成する。
  • HOOFが学習したハイパーパラメータ(例:δ、γ、λ)は、環境ごとに有意に異なるため、固定値ではなく動的適応の必要性が示された。
  • KL制約は重要度サンプリング推定の安定化に不可欠である。これがないとWIS推定は信頼性を失い、学習が失敗する。
  • SGDをRMSPropの代わりに使用しても、HOOFは依然として効果的であり、最適化手法の選択に対してロバストである。これに対して、ベースラインA2CはSGD下で学習に失敗する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。