Skip to main content
QUICK REVIEW

[論文レビュー] ANS: Adaptive Network Scaling for Deep Rectifier Reinforcement Learning Models

Yueh-Hua Wu, Fan-Yun Sun|arXiv (Cornell University)|Sep 6, 2018
Reinforcement Learning in Robotics参考文献 22被引用数 3
ひとこと要約

本論文では、深層ReLUベースの強化学習エージェントの性能を向上させるために、訓練中に報酬スケーリングを動的に調整する手法であるAdaptive Network Scaling (ANS)を提案する。ANSにより、ReLUネットワークは最適な報酬スケールを自動で発見でき、固定スケーリングやELU・シグモイドなどの代替活性化関数よりも顕著に優れた性能を発揮する。

ABSTRACT

This work provides a thorough study on how reward scaling can affect performance of deep reinforcement learning agents. In particular, we would like to answer the question that how does reward scaling affect non-saturating ReLU networks in RL? This question matters because ReLU is one of the most effective activation functions for deep learning models. We also propose an Adaptive Network Scaling framework to find a suitable scale of the rewards during learning for better performance. We conducted empirical studies to justify the solution.

研究の動機と目的

  • 報酬スケーリングが深層ReLUベースの強化学習モデルに与える影響、特に死滅ReLU問題との関連を調査すること。
  • 飽和型活性化関数とは対照的に、非飽和型活性化関数(ReLU)がより大きな報酬スケールから利益を受けるかどうかを特定すること。
  • 再訓練を必要とせず、最適な報酬スケーリングを自動で特定する手法を開発すること。
  • アクタ・クリティックフレームワークにおける異なる活性化関数(ReLU、ELU、Leaky-ReLU、シグモイド、tanh)に対する報酬スケーリングの影響を評価すること。

提案手法

  • 訓練中に累積報酬の改善に基づき報酬スケールを動的に調整する、Adaptive Network Scaling (ANS)フレームワークを提案する。
  • 累積報酬が改善するとスケーリング要因が乗算的に増加し、停滞すると減少する仕組みを採用。調整パラメータ $ c_{\text{inc}} $ と $ c_{\text{dec}} $ は設定可能である。
  • ネットワークアーキテクチャの変更や最適スケールの事前知識を必要とせず、DDPGおよびA2Cといったアクタ・クリティックアルゴリズムにANSを統合する。
  • スケールの調整を判定するための許容範囲閾値 $ T $ を用い、直近 $ T $ エピソードまたはフレームの性能に基づく。
  • 活性化の飽和と訓練の安定性の指標として、死滅ReLUユニット(疑似死滅ReLU)の割合をモニタリングする。
  • スケーリング要因の更新を滑らかにするために、$ \beta = 0.9 $ のデイエイドメカニズムを採用し、振動を防止する。

実験結果

リサーチクエスチョン

  • RQ1報酬スケーリングはReLUベースの深層強化学習モデルの性能にどのように影響を与えるか。また、シグモイドやtanhといった飽和型活性化関数とは異なる挙動を示すか?
  • RQ2報酬スケーリングと深層RLエージェントにおける死滅ReLU問題の関係は何か?
  • RQ3非飽和型活性化関数(Leaky-ReLU や ELU)は、強化学習訓練において異なる報酬スケールにどのように反応するか?
  • RQ4再訓練を伴わず、訓練中に最適な報酬スケールを自動で発見できる適応的メカニズムを設計できるか?

主な発見

  • ANSは性能を顕著に向上させる:DDPGにANSを適用した場合、HalfCheetah-v2で平均報酬9393.24を達成し、元のReLU DDPG(7944.54)およびELU(7899.17)を上回る。
  • A2CにANSを適用した場合、HalfCheetah-v2で3689.64を達成し、他のすべての活性化関数やPop-Art(-455.57)を上回る。
  • 固定報酬スケーリングなしでも、ANSを用いたReLUネットワークはELU、シグモイド、tanhを用いたモデルを上回り、優れたサンプル効率と最終性能を示す。
  • ReLUの最適報酬スケールは予想よりも大きいことが多く、ANSは通常、スケールを64まで増大させた後で減少させる。これは、より大きなスケールが学習を改善することを示唆している。
  • 疑似死滅ReLUユニットの割合は、報酬スケールと最終累積報酬の両者と強く相関しており、訓練の安定性を診断する有効な指標であることが裏付けられた。
  • 平均0・分散1を強制するPop-Artは、ANSや元のReLUモデルよりも性能が劣っており、ReLUを用いたアクタ・クリティック手法には最適でないことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。