[論文レビュー] Effective Model Sparsification by Scheduled Grow-and-Prune Methods
本論文は、事前学習された密度モデルを避けるために、連続する層パーティションを段階的に成長・ pruning するスケジューリングされた成長・pruning(GaP)手法を提案する。このアプローチにより、高いスパarsity(例:非一様スパースなResNet-50で90%のスパarsity)において最先端の精度を達成——ImageNetではトップ1精度77.9%を記録——従来手法を上回り、メモリ使用量を削減するとともに、構造的な層パーティション化とスケジューリングされた成長・pruningにより、重みの体系的探索によって重みカバレッジを向上させる。
Deep neural networks (DNNs) are effective in solving many real-world problems. Larger DNN models usually exhibit better quality (e.g., accuracy) but their excessive computation results in long inference time. Model sparsification can reduce the computation and memory cost while maintaining model quality. Most existing sparsification algorithms unidirectionally remove weights, while others randomly or greedily explore a small subset of weights in each layer for pruning. The limitations of these algorithms reduce the level of achievable sparsity. In addition, many algorithms still require pre-trained dense models and thus suffer from large memory footprint. In this paper, we propose a novel scheduled grow-and-prune (GaP) methodology without having to pre-train a dense model. It addresses the shortcomings of the previous works by repeatedly growing a subset of layers to dense and then pruning them back to sparse after some training. Experiments show that the models pruned using the proposed methods match or beat the quality of the highly optimized dense models at 80% sparsity on a variety of tasks, such as image classification, objective detection, 3D object part segmentation, and translation. They also outperform other state-of-the-art (SOTA) methods for model sparsification. As an example, a 90% non-uniform sparse ResNet-50 model obtained via GaP achieves 77.9% top-1 accuracy on ImageNet, improving the previous SOTA results by 1.5%. Code available at: https://github.com/boone891214/GaP.
研究の動機と目的
- 従来のモデルスパース化手法が単方向的な重みpruningに依存するか、事前学習済みの密度モデルに依存するという限界を是正すること。
- スパース化中に事前学習された密度モデルの必要性を排除することで、メモリ使用量を削減すること。
- 構造的な層パーティション化とスケジューリングされた成長・pruningにより、すべての重みを体系的に探索することで、スパarsity-精度トレードオフを改善すること。
- トレーニング中に動的重み再評価を可能にすることで、高スパarsityレベルでも優れたモデル品質を達成すること。
提案手法
- GaP手法はDNNを連続する層に分割し、これらのパーティションに対する反復的成長・pruningをスケジューリングする。
- サイクル型GaPでは、1つのパーティションを密度化し、他のパーティションはスパースのままにし、学習後にそのパーティションをpruningし、次に次のパーティションを成長させる。全パーティションを順に巡回する。
- 並列型GaPでは、複数のマシン上で同時に複数のモデルを学習し、それぞれのマシンで異なるパーティションを順次密度化する。
- 重みの完全カバレッジを保証するため、パーティションが密度化段階にある間、そのパーティション内のすべての重みを探索する。これにより、ランダムまたはグリーディな探索による不完全なカバレッジを回避する。
- 学習全体を通してスパarsityを維持し、パーティション内のすべての重みが探索された後のみ、スパースマスクを更新する。
- 標準的な仮定の下で、サブ線形収束速度O(1/√Q)を示す理論的裏付けを有する。ここでQはトレーニングサイクルの数である。
実験結果
リサーチクエスチョン
- RQ1事前学習された密度モデルを必要とせずに、モデルスパース化を実現できるか。これにより、メモリオーバーヘッドが削減されるか。
- RQ2体系的でパーティションベースの成長・pruningは、ランダムまたはグリーディな探索に比べ、より良い重みカバレッジとモデル品質をもたらすか。
- RQ3提示されたスケジューリングされたGaP手法は、多様なビジョンおよびNLPタスクにおいて、高スパarsityレベルで最先端の精度を達成できるか。
- RQ4スケジューリングされたGaP手法の収束特性は、既存のスパーストレーニング手法と比較してどのように異なるか。
主な発見
- 90%の非一様スパースなResNet-50モデルをGaPで学習した場合、ImageNetでトップ1精度77.9%を達成。これは従来のSOTAを1.5%上回る。
- 80%のスパarsityにおいて、画像分類、オブジェクト検出、3次元セグメンテーション、機械翻訳のタスクで、高度に最適化された密度モデルと同等またはそれ以上の精度を達成。
- 特に高スパarsityレベルにおいて、RigL、DSR、SETといった最先端のスパース化技術を上回る性能を発揮。
- 理論的分析により、サイクル型GaP手法が標準的な仮定の下でサブ線形収束速度O(1/√Q)を示すことが確認された。ここでQはトレーニングサイクルの数である。
- 事前学習済みの密度モデルの必要性を排除することで、メモリ使用量を削減し、リソース制約のある学習環境に適したアプローチである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。