Skip to main content
QUICK REVIEW

[論文レビュー] Growing Efficient Deep Networks by Structured Continuous Sparsification

Xin Yuan, Pedro Savarese|arXiv (Cornell University)|Jul 30, 2020
Multimodal Machine Learning Applications参考文献 49被引用数 9
ひとこと要約

本論文は、構造的連続スパース化を用いて、トレーニング中に深層ニューラルネットワークの成長と刈り込みを動的に実行する手法を提案する。アーキテクチャの意思決定を微分可能に緩和し、確率的サンプリングを用いて、精度と効率の両方を最適化する。ImageNetにおいて、推論時で49.7%、トレーニング時で47.4%のFLOPsを削減しながら、微調整なしで75.2%のトップ-1精度を維持する。

ABSTRACT

We develop an approach to growing deep network architectures over the course of training, driven by a principled combination of accuracy and sparsity objectives. Unlike existing pruning or architecture search techniques that operate on full-sized models or supernet architectures, our method can start from a small, simple seed architecture and dynamically grow and prune both layers and filters. By combining a continuous relaxation of discrete network structure optimization with a scheme for sampling sparse subnetworks, we produce compact, pruned networks, while also drastically reducing the computational expense of training. For example, we achieve $49.7\%$ inference FLOPs and $47.4\%$ training FLOPs savings compared to a baseline ResNet-50 on ImageNet, while maintaining $75.2\%$ top-1 accuracy -- all without any dedicated fine-tuning stage. Experiments across CIFAR, ImageNet, PASCAL VOC, and Penn Treebank, with convolutional networks for image classification and semantic segmentation, and recurrent networks for language modeling, demonstrate that we both train faster and produce more efficient networks than competing architecture pruning or search methods.

研究の動機と目的

  • 最適化中にネットワークアーキテクチャを動的に成長・刈り込みすることで、深層ネットワークのトレーニングにかかる計算コストを低減すること。
  • ニューラルアーキテクチャ探索や刈り込みにおいて、大規模なスーパーネットアーキテクチャやトレーニング後の微調整の必要性を排除すること。
  • 最小限のシードアーキテクチャから開始し、リソース制約下で構造を適応的に成長させることで、モデルの効率性とトレーニング速度を向上させること。
  • 重みとアーキテクチャのエンドツーエンド同時最適化により、従来の刈り込み法やNAS手法よりも優れた精度-効率トレードオフを達成すること。
  • 段階的にネットワークサイズを拡大することで、より速く大バッチでのトレーニングを可能にし、ウォルクロック時間とGPU時間の両方を短縮すること。

提案手法

  • フィルターや層のインジケータ変数を用いてアーキテクチャを構成空間としてパrameter化し、離散的な構造的意思決定を連続的に緩和可能にする。
  • Gumbel-Softmaxサンプリングを用いた微分可能緩和により、アーキテクチャの成長・刈り込みを制御する補助マスク変数を学習する。
  • 構造ごとの温度スケジューリング戦略により安定した収束を確保し、初期エポックでは高温のサンプリングを行い、徐々に離散的決定へと硬くする。
  • 学習済みのマスクパラメータを用いて、緩和されたアーキテクチャからスパースサブネットワークをサンプリングし、効率的なトレーニングと推論を可能にする。
  • 確率的勾配降下法を用いて、重みとアーキテクチャ要因を同時に最適化するが、別段階の微調整は不要である。
  • 本手法は、フィルタ(チャネル単位)と完全な層の両方の成長をサポートしており、トレーニング中に深さと幅の動的再構成が可能である。

実験結果

リサーチクエスチョン

  • RQ1固定された大規模アーキテクチャから始めるのではなく、最適化中にアーキテクチャを動的に成長させることで、深層ネットワークのトレーニングをより効率的に行えるか?
  • RQ2アーキテクチャ探索と刈り込みを、1つのエンドツーエンド微分可能なトレーニング手順に統合できるか?
  • RQ3精度とスパarsityの目的に応じて、小さな初期状態からネットワークを成長させることで、トレーニングコストをどの程度低減できるか?
  • RQ4固定されたコンパクトなアーキテクチャを直接トレーニングするのと比較して、動的アーキテクチャ進化は、より良い一般化性や正則化をもたらすか?
  • RQ5ランダムまたは均一な刈り込みベースラインと比較して、構造的連続スパース化は、精度とパラメータ効率の両面で優れているか?

主な発見

  • ImageNetにおいて、本手法は推論時で49.7%、トレーニング時で47.4%のFLOPsをResNet-50より削減しながら、微調整なしで75.2%のトップ-1精度を維持する。
  • CIFAR-10では、VGG-16に対してわずか0.754Mパラメータで92.50%の検証精度を達成し、ランダム刈り込みベースライン(90.01%精度)と直接再トレーニングベースラインを上回る。
  • ResNet-20では、160エポック後に92.36%の検証精度に到達し、360エポックで84.65%の精度を達成したAutoGrowを上回り、収束が速いことが示された。
  • 構造ごとの温度スケジューラーを用いることで、グローバル温度制御に起因する早期収束問題を回避でき、WideResNet-28-10では精度低下を最大2.5%まで低減した。
  • NASベースラインと比較して、GPU探索時間は45%削減され、同等またはより優れた精度-パラメータトレードオフを達成した。
  • アブレーションスタディにおいて、本手法はあらゆる予算設定で均一刈り込みとランダムサンプリングベースラインを上回り、構成空間と成長メカニズムの有効性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。