[論文レビュー] Non-Differentiable Supervised Learning with Evolution Strategies and Hybrid Methods
本稿では、微分可能な重みの勾配最適化と、微分不可能なスパarsityマスクを学習する進化戦略(ES)を組み合わせたハイブリッドトレーニング手法を提案する。ESを複数のデバイスに並列化することで、最小限のトレーニングオーバーヘッドで標準的なSGDと同等の性能を達成し、密度のある事前学習フェーズを必要とせず、スパースモデルをスクラッチからエンドツーエンドでトレーニング可能となる。
In this work we show that Evolution Strategies (ES) are a viable method for learning non-differentiable parameters of large supervised models. ES are black-box optimization algorithms that estimate distributions of model parameters; however they have only been used for relatively small problems so far. We show that it is possible to scale ES to more complex tasks and models with millions of parameters. While using ES for differentiable parameters is computationally impractical (although possible), we show that a hybrid approach is practically feasible in the case where the model has both differentiable and non-differentiable parameters. In this approach we use standard gradient-based methods for learning differentiable weights, while using ES for learning non-differentiable parameters - in our case sparsity masks of the weights. This proposed method is surprisingly competitive, and when parallelized over multiple devices has only negligible training time overhead compared to training with gradient descent. Additionally, this method allows to train sparse models from the first training step, so they can be much larger than when using methods that require training dense models first. We present results and analysis of supervised feed-forward models (such as MNIST and CIFAR-10 classification), as well as recurrent models, such as SparseWaveRNN for text-to-speech.
研究の動機と目的
- 微分不可能なスパースネスマスクを最適化する進化戦略(ES)を、数百万パラメータを持つ大規模で複雑な教師ありモデルにスケーリング可能かどうかを調査すること。
- ESが非微分可能なスパースネスマスクを最適化する一方で、SGDが微分可能な重みを並列にトレーニングするハイブリッドトレーニングフレームワークを構築すること。
- 密度のある事前学習フェーズを回避し、最初のトレーニングステップからスパースニューラルネットワークをトレーニング可能にする。
- フィードフォワードおよびリカレントアーキテクチャの両方における、ESベースのスパースネス学習の性能と効率を評価すること。対象タスクには画像分類および音声対テキスト生成が含まれる。
提案手法
- CIFAR-10における大規模なConvNetにESを適用する際の計算効率を向上させるために、セミアップデート実行モデルを導入する。
- 再パrameter化を用いて、二値スパースネスマスクを微分可能なパラメータとしてモデル化する連続的ESバージョン(C-ES)を用いて、マスクの分布を最適化する。
- 複数のGPUを用いた並列推論により、スパースネスマスクはESで、ネットワーク重みはAdamで同時にトレーニングする。
- 特にリカレントモデルにおいて効率を向上させるために、ブロック単位のスパースネス制約を適用し、ESのパラメータ数を削減する。
- パラメータテンソルごとに別々のマスク分布を用いることで、実行速度の向上と細粒度なスパースネス制御を実現する。
- ESのブラックボックス性を活用し、勾配計算を必要としない非微分可能な要因(例:スパースネスパターン、実行速度)を最適化する。
実験結果
リサーチクエスチョン
- RQ1進化戦略(ES)は、CIFAR-10における大規模な非微分可能な教師ありモデル(例:ConvNet)に効果的にスケーリング可能か?
- RQ2ハイブリッドトレーニング設定下で、スパースネスマスクのトレーニングにおいてESの性能は標準的なSGDと比べてどうか?
- RQ3ESによるマスク最適化を用いることで、密度のある事前学習を回避してスパースモデルをスクラッチからトレーニング可能か?
- RQ4複数のデバイスに並列化した場合、ESを用いたスパースネスマスク学習の計算オーバーヘッドはどの程度か?
- RQ5ブロック単位のスパースネス制約は、リカレントモデルにおけるESベースのトレーニングの性能と効率にどのように影響するか?
主な発見
- CIFAR-10では、セミアップデートモデルを用いた本手法により、90.56%から91.77%のテスト精度を達成し、SGDの性能に近いがそれを上回ることはなかった。
- SparseWaveRNNモデルでは、C-ESが97%のスパースネスとブロック幅16で、WR1792においてテストNLL 5.56を達成し、プリーニングベースラインと同等またはわずかに優れた性能を示した。
- C-ESの計算オーバーヘッドは生成サイズとほぼ同等であり、8つのGPUを用いることで、推論速度はプリーニングと同等(例:ブロック幅16のWR1792では0.45 FPS)となった。
- 固定マスク分布を用いたFixMaskは、初期スパースネスが高水準(例:90%)の状態で一般化に失敗したが、C-ESは全初期スパースネスレベルで安定した性能を維持した。
- C-ESにより、スクラッチからスパースモデルをトレーニング可能となり、密度のある事前学習の必要性が排除された。これは、メモリに収まらないほど大きなモデルにとって特に有益である。
- 本手法は、勾配ベースのトレーニングと組み合わせることで、スパースネスパターンのような非微分可能な要素を最適化するための実用的代替手段としてESが有効であることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。