Skip to main content
QUICK REVIEW

[論文レビュー] Adapting Behaviour for Learning Progress

Tom Schaul, Diana Borsa|arXiv (Cornell University)|Dec 14, 2019
Advanced Bandit Algorithms Research参考文献 41被引用数 8
ひとこと要約

本論文では、学習進捗の代理指標に基づいて、確率的、楽観的、一貫性のある行動など、ポリシーの変更(stochasticity, optimism, consistency など)を動的に選択する非定常マルチアームバンディットを用いて、強化学習中のエージェントの探索行動を自律的に適応させる手法を提案する。このアプローチは、タスク固有のハイパーパramータチューニングと同等のパフォーマンスを達成しつつ、手動による介入や追加のトレーニングランを必要とせず、コストの僅か数分の1で実現する。

ABSTRACT

Determining what experience to generate to best facilitate learning (i.e. exploration) is one of the distinguishing features and open challenges in reinforcement learning. The advent of distributed agents that interact with parallel instances of the environment has enabled larger scales and greater flexibility, but has not removed the need to tune exploration to the task, because the ideal data for the learning algorithm necessarily depends on its process of learning. We propose to dynamically adapt the data generation by using a non-stationary multi-armed bandit to optimize a proxy of the learning progress. The data distribution is controlled by modulating multiple parameters of the policy (such as stochasticity, consistency or optimism) without significant overhead. The adaptation speed of the bandit can be increased by exploiting the factored modulation structure. We demonstrate on a suite of Atari 2600 games how this unified approach produces results comparable to per-task tuning at a fraction of the cost.

研究の動機と目的

  • 強化学習における手動ハイパーパramータチューニングへの依存を減らし、探索行動の自動適応を可能にすること。
  • 学習進捗を最大化するポリシーの変更(modulations)を動的に選択することで、サンプル効率を向上させること。
  • 分散強化学習エージェントにおける行動適応のためのスケーラブルで低オーバーヘッドのメカニズムを開発すること。
  • 一様で適応的なアプローチが、多様なAtari 2600環境において、タスク固有にチューニングされた性能と同等またはそれを上回ることを実証すること。

提案手法

  • 非定常マルチアームバンディットを用いて、ポリシーの探索的行動を変更する複数の行動変更(例:温度、ε-greedy、各行動バイアス)のうち、1エピソードに1回だけ選択し、そのエピソード中は固定される。
  • 各行動変更は、経験収集中に一貫した行動的変化をもたらす。
  • 各行動変更 $ z $ に対して、分位数ベースの価値関数近似の変化に基づいて、学習進捗の代理指標 $ f(z) $ を推定する。
  • 適応を高速化するために、バンドイットが要因分解構造を用いる。
  • エージェントのポリシーは、分位数ベースの分布強化学習アルゴリズムで更新され、行動ポリシーは学習済みパramータ $ \theta $ と変更ベクトル $ z $ を介して変更される。
  • システムはトレーニング中にオンラインで動作し、推定された学習進捗の代理指標を最大化するように、継続的に行動変更を適応させる。

実験結果

リサーチクエスチョン

  • RQ1一様で適応的な行動変更手法は、強化学習においてタスク固有のハイパーパramータチューニングと同等のパフォーマンスを達成できるか?
  • RQ2非定常マルチアームバンディットは、エージェントの学習進捗を追跡する形で、探索行動を効果的に最適化できるか?
  • RQ3確率的・楽観的行動変更を動的に適応させることで、多様な環境においてサンプル効率が向上するか?
  • RQ4この手法は、学習パフォーマンスを維持または向上させつつ、どの程度手動チューニングの必要性を低減できるか?

主な発見

  • 提案手法は、手動チューニングを一切行わず、Atari 2600ゲームの複数のゲームで、タスク固有にチューニングされたハイパーパramータと同等のパフォーマンスを達成した。
  • バンディットによる行動変更の適応は、現在の学習段階に合ったデータ生成に集中させることで、顕著なサンプル効率の向上をもたらした。
  • 広範なハイパーパramータサーチの必要性が低減された。トレーニング中に最適な行動変更を自律的に選択するためである。
  • 要因分解されたバンディット構造のおかげで、学習ダイナミクスの変化に迅速に適応でき、学習進捗の変化に迅速に対応できるようになった。
  • 固定された行動変更を用いたベースラインより優れた性能を示し、実験では最良の固定アーム設定と同等またはそれを上回った。
  • 計算的に効率的でスケーラブルであり、最小限のオーバーヘッドであるため、大規模な分散強化学習トレーニングに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。