Skip to main content
QUICK REVIEW

[論文レビュー] The State of Sparse Training in Deep Reinforcement Learning

Laura Graesser, Utku Evci|arXiv (Cornell University)|Jun 17, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本研究では、スパーストレーニング技術(スプライニング、スタティックスパースネス、SET、RigL)を深層強化学習(DRL)で体系的に評価し、DQN、SAC、PPOエージェントにおいて、同等のパラメータ数でもスパースネットワークが密なネットワークを上回ることを示した。主な発見は、80–90%のスパースネスを持つネットワークが密な性能に近く達成でき、動的スパースネスと非一様なパラメータ割り当て(特にクライアントを優遇)が最適な結果をもたらすことである。

ABSTRACT

The use of sparse neural networks has seen rapid growth in recent years, particularly in computer vision. Their appeal stems largely from the reduced number of parameters required to train and store, as well as in an increase in learning efficiency. Somewhat surprisingly, there have been very few efforts exploring their use in Deep Reinforcement Learning (DRL). In this work we perform a systematic investigation into applying a number of existing sparse training techniques on a variety of DRL agents and environments. Our results corroborate the findings from sparse training in the computer vision domain - sparse networks perform better than dense networks for the same parameter count - in the DRL domain. We provide detailed analyses on how the various components in DRL are affected by the use of sparse networks and conclude by suggesting promising avenues for improving the effectiveness of sparse training methods, as well as for advancing their use in DRL.

研究の動機と目的

  • スパーストレーニング技術がコンピュータビジョンで有効であるのと同じように、深層強化学習(DRL)に対しても効果を示すかを調査すること。
  • オンライントレーニング設定下で、スプライニング、スタティックスパースネス、SET、RigLといった複数のスパーストレーニング手法がDRLエージェントに与える性能を評価すること。
  • アーキテクチャ的およびトレーニングのハイパーパrameter(例:スパースネス分布、重み減衰、バッチサイズ、初期化)がスパースDRL性能に与える影響を分析すること。
  • スパースネットワークが、特に観測ノイズの存在下でも、DRLにおけるロバストネスと一般化性能を向上させるかを検証すること。
  • 実用的なスパースDRLエージェントの展開に役立つ具体的な推奨事項を提示すること。具体的には、最適なパラメータ割り当てとスパースネス戦略を含む。

提案手法

  • 価値ベース(DQN)およびアクタクリティック(SAC、PPO)DRLエージェントに、スプライニング、スタティックスパースネス、SET、RigLの4つのスパーストレーニングアルゴリズムを適用した。
  • 構造的スパースネスのためのErdős–Rényi Kernel(ERK)スパースネス分布を用い、アクターとクリティックネットワーク間で非一様なパラメータ割り当てを実施した。
  • バッチサイズ、重み減衰、初期化方式を含む制御されたハイパーパrameter設定下で、複数の環境(例:Atari、MuJoCo)においてスパースネスを評価した。
  • トポロジー更新戦略を用いて動的スパースネスを実装し、RigLではトレーニング中に勾配に基づく重み増加を可能にした。
  • 勾配の信号対ノイズ比(SNR)、バッチサイズ、スパースネス更新頻度のアブレーションスタディを実施し、トレーニングの安定性を評価した。
  • GitHub(github.com/google-research/rigl/tree/master/rigl/rl)から提供されたコードを再現し、再現性を確保した。

実験結果

リサーチクエスチョン

  • RQ1コンピュータビジョンと同様に、DRLにおけるスパースニューラルネットワークは、同じパラメータ数の密ネットワークと同等の性能を達成できるか?
  • RQ2スプライニング、スタティックスパースネス、SET、RigLの中で、オンラインDRLトレーニングにおいて最も優れた性能を示すのはどれか?
  • RQ3アクタクリティックパラメータ比やスパースネス分布といったアーキテクチャ的選択が、DRLトレーニングの安定性と性能に与える影響は何か?
  • RQ4スパースネスは、DRL環境における観測ノイズに対してロバストネスを向上させるか?
  • RQ5RigLはビジョン分野では成功しているが、DRLではスプライニングに劣っている。これは、高スパースネス領域における勾配のSNRが低いためではないか?

主な発見

  • すべての評価対象DRLエージェントと環境において、スパースニューラルネットワークが同じパラメータ数の密ネットワークを一貫して上回る性能を示した。
  • 80–90%のスパースネスを持つネットワークが、密ベースラインの5%以内の性能を達成しており、高いパラメータ効率性を示した。
  • すべてのスパーストレーニング手法の中でスプライニングが最も優れた性能を示した一方、動的スパーストレーニング(例:SET)はスタティックスパースネスを著しく上回った。
  • 勾配に基づく成長(RigL)は限定的な改善にとどまり、高スパースネストレーニングにおける勾配の信号対ノイズ比(SNR)が低いことが主な要因とみられる。
  • 非一様なスパースネス分布、特にクライアントネットワークに大部分のパラメータを割り当て、ERKベースのスパースネスパターンを用いることで最適な性能が達成された。
  • スパースネットワークは観測ノイズに対してより高いロバストネスを示しており、一般化性能および実世界への展開における利点が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。