Skip to main content
QUICK REVIEW

[論文レビュー] Action Noise in Off-Policy Deep Reinforcement Learning: Impact on Exploration and Performance

Jakob Hollenstein, Sayantan Auddy|arXiv (Cornell University)|Jun 8, 2022
Reinforcement Learning in Robotics被引用数 6
ひとこと要約

本稿は、連続的制御のオフポリシー深層強化学習における行動ノイズの影響を調査し、ガウス分布型とオーレンシュタイン・アウルバック型のノイズタイプとスケールを比較している。訓練過程でノイズスケールを低減することで性能とロバストネスが向上することを発見し、境界推定アーティファクトに弱い既存の指標を補完する新たな状態空間カバレッジ指標 X_Urel を提案した。

ABSTRACT

Many Deep Reinforcement Learning (D-RL) algorithms rely on simple forms of exploration such as the additive action noise often used in continuous control domains. Typically, the scaling factor of this action noise is chosen as a hyper-parameter and is kept constant during training. In this paper, we focus on action noise in off-policy deep reinforcement learning for continuous control. We analyze how the learned policy is impacted by the noise type, noise scale, and impact scaling factor reduction schedule. We consider the two most prominent types of action noise, Gaussian and Ornstein-Uhlenbeck noise, and perform a vast experimental campaign by systematically varying the noise type and scale parameter, and by measuring variables of interest like the expected return of the policy and the state-space coverage during exploration. For the latter, we propose a novel state-space coverage measure $\operatorname{X}_{\mathcal{U} ext{rel}}$ that is more robust to estimation artifacts caused by points close to the state-space boundary than previously-proposed measures. Larger noise scales generally increase state-space coverage. However, we found that increasing the space coverage using a larger noise scale is often not beneficial. On the contrary, reducing the noise scale over the training process reduces the variance and generally improves the learning performance. We conclude that the best noise type and scale are environment dependent, and based on our observations derive heuristic rules for guiding the choice of the action noise as a starting point for further optimization.

研究の動機と目的

  • オフポリシー深層強化学習における探索と学習性能に与える行動ノイズタイプ(ガウス分布型対オーレンシュタイン・アウルバック型)およびスケールの影響を調査すること。
  • 訓練時間に伴い行動ノイズの影響を動的に低減する(ノイズスケジュール)ことがポリシー性能と分散に与える影響を評価すること。
  • 境界推定アーティファクトに弱い既存の指標を補完するよりロバストな状態空間カバレッジ指標 X_Urel を開発・検証すること。
  • 環境固有の特性に基づいて行動ノイズ設定を選択するためのヒューリスティックなガイドラインを導出すること。
  • 6つの連続的制御ベンチマークにおいて、DDPG、TD3、SAC、detSAC を、さまざまなノイズ条件の下で実験的に比較すること。

提案手法

  • 複数のアルゴリズムと環境において、行動ノイズタイプ(ガウス分布型、オーレンシュタイン・アウルバック型)、スケール(σ = 0.1 から 1.7)、ノイズ低減スケジュール(β減衰)を体系的に変化させる。
  • 従来の指標に比べて状態空間境界付近の推定アーティファクトに対して感受性が低い、新たな状態空間カバレッジ測定指標 X_Urel を提案する。
  • 6つの環境(Mountain-Car、Inverted-Pendulum-Swingup、Reacher、Hopper、Walker2D、Half-Cheetah)にわたり包括的な実験キャンペーンを実施する。
  • 期待報酬と状態空間カバレッジの両方を指標として用い、10回の独立実行における中央値報酬と四分位範囲を測定する。
  • 訓練過程でノイズ影響係数 β を低下させることで、探索的行動から実行的行動へのシフトを模擬するノイズ低減スケジュールを適用する。
  • 公平な比較を確保し、ノイズ設定の影響を孤立させるために、先行研究(例:Raffin, 2020)で調整済みのハイパーパrameterを用いる。

実験結果

リサーチクエスチョン

  • RQ1ガウス分布型とオーレンシュタイン・アウルバック型の行動ノイズの選択が、オフポリシーDRLにおける学習性能と状態空間カバレッジに与える影響は何か?
  • RQ2行動ノイズスケールの増大が、さまざまな環境における状態空間カバレッジと最終的ポリシー性能に与える影響は何か?
  • RQ3訓練時間に伴いノイズ影響(β)を低減することは、学習性能の向上と分散の低減に寄与するか?
  • RQ4提案された X_Urel 指標は、境界効果に対して従来のカバレッジ測定指標と比較してどれほどロバストか?
  • RQ5環境のダイナミクスと探索ニーズに基づいて、行動ノイズタイプとスケールを選択するためのヒューリスティックなルールは何か?

主な発見

  • ガウス分布型とオーレンシュタイン・アウルバック型ノイズの選択は環境依存的である:どちらのタイプも普遍的に優れているとは言えない。特にMountain-Carのような環境では顕著な性能差が観察された。
  • 行動ノイズスケールの増大は一貫して状態空間カバレッジを向上させるが、多くの場合最終的な学習性能を低下させることが示され、探索の広がりと学習効率のトレードオフが明確になった。
  • 訓練時間に伴いノイズ影響係数 β を低減することで、多数の環境で性能が向上し、実行間の分散も顕著に低減された。
  • 提案された X_Urel 指標は、従来の指標と比較して状態空間境界付近の点に対する感受性が低く、よりロバストな状態空間カバレッジ推定を可能にした。
  • ノイズ設定において最も重要な要因はノイズスケール σ である:カバレッジが不要な場合には小さいスケールが好ましく、広範な探索が求められる場合には大きなスケールが有効である。
  • 特にゴールへの軌道が発見された後は、ノイズ影響のスケジューリングによる低減を一般戦略として推奨する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。