Skip to main content
QUICK REVIEW

[論文レビュー] Hidden-Fold Networks: Random Recurrent Residuals Using Sparse Supermasks

Ángel López García-Arias, Masanori Hashimoto|arXiv (Cornell University)|Nov 24, 2021
Advanced Neural Network Applications参考文献 33被引用数 4
ひとこと要約

本稿では、重みを再利用して時間ステップを繰り返すことで、残差接続を畳み込み、重みの更新なしにスパースなスーパー・マスクを用いて高精度なサブネットワークを発見することにより、ResNetを極めて効率的な再帰的アーキテクチャに圧縮する、隠れ折りたたみネットワーク(HFNs)を提案する。HFNは、CIFAR100およびImageNetでResNetと同等の性能を達成しながら、メモリ使用量を26.8倍から38.5倍まで削減し、ランダムで再利用可能な重みとバイナリ・スーパー・マスクを用いることで、専用ハードウェア上でオフチップメモリアクセスを最小限に抑えることにより、超低消費電力推論を実現する。

ABSTRACT

Deep neural networks (DNNs) are so over-parametrized that recent research has found them to already contain a subnetwork with high accuracy at their randomly initialized state. Finding these subnetworks is a viable alternative training method to weight learning. In parallel, another line of work has hypothesized that deep residual networks (ResNets) are trying to approximate the behaviour of shallow recurrent neural networks (RNNs) and has proposed a way for compressing them into recurrent models. This paper proposes blending these lines of research into a highly compressed yet accurate model: Hidden-Fold Networks (HFNs). By first folding ResNet into a recurrent structure and then searching for an accurate subnetwork hidden within the randomly initialized model, a high-performing yet tiny HFN is obtained without ever updating the weights. As a result, HFN achieves equivalent performance to ResNet50 on CIFAR100 while occupying 38.5x less memory, and similar performance to ResNet34 on ImageNet with a memory size 26.8x smaller. The HFN will become even more attractive by minimizing data transfers while staying accurate when it runs on highly-quantized and randomly-weighted DNN inference accelerators. Code available at https://github.com/Lopez-Angel/hidden-fold-networks

研究の動機と目的

  • 大規模なDNNの高いメモリおよび消費電力コストに対処するため、ResNetを極めて効率的で低メモリなアーキテクチャに圧縮すること。
  • ランダムに初期化されたネットワークにおけるロットリート・チケット仮説とサブネットワーク発見を活用し、重みの更新なしに、折りたたまれた再帰的構造内に正確な未学習サブネットワークを発見すること。
  • オンチップに保存されたスパースなスーパー・マスクとランダムシードを用いて、オフチップメモリアクセスを最小限に抑えることで、エネルギー効率の良いDNN推論を実現すること。
  • ResNetを再帰的構造に折りたたむことで、標準的な順方向モデルと比較して、隠れたサブネットワークの精度が向上するかどうかを検証すること。
  • 低消費電力で高精度に量子化された推論アクセラレータに適した、コンactかつ正確なモデルを設計すること。

提案手法

  • 同じ重みセットを複数の時間ステップにわたって再利用することで、標準的なResNetを再帰的アーキテクチャに折りたたむ。これにより、パラメータ数とメモリ使用量が削減される。
  • 重みの更新なしに、ランダムに初期化された折りたたまれたネットワーク内にスパースで高性能なサブネットワークを特定するため、学習可能なバイナリ・スーパー・マスクを用いる。
  • バイナリ・マスクの微分可能近似を用いてスーパー・マスクを学習し、スパarsityを維持しながら精度を最適化する。
  • スパースなスーパー・マスクを用いて、推論時に再帰的に再利用される重みのうち、必要な部分のみを活性化することで、効率的なバイナリ演算を実現する。
  • 固定で学習しない重みを生成するためのランダムシードを用いることで、オフチップメモリへのパラメータ保存の必要性を排除する。
  • オンチップでの乱数生成とバイナリ・マスク演算をサポートする専用推論アクセラレータと互換性を持つアーキテクチャを設計する。

実験結果

リサーチクエスチョン

  • RQ1標準的な順方向モデルと比較して、ResNetを再帰的構造に折りたたむことで、スーパー・マスクを用いたサブネットワーク発見における隠れたサブネットワークの精度が向上するか?
  • RQ2重みの折りたたみとスーパー・マスクベースのサブネットワーク発見を組み合わせることで、深層ネットワークのメモリ使用量をどの程度削減できるか?
  • RQ3CIFAR100およびImageNetといった標準ベンチマークにおいて、HFNの性能は、標準的なResNetと比較して、精度とモデルサイズの点でどの程度異なるか?
  • RQ4オンチップにスーパー・マスクとランダムシードを保存することで、オフチップメモリアクセスを最小限に抑えることにより、HFNが顕著なエネルギー節約を達成できるか?
  • RQ5HFNの精度を最大化すると同時に、モデルサイズと計算コストを最小限に抑えるために、最適なスーパー・マスク密度とトレーニングスケジュールは何か?

主な発見

  • HFNは、CIFAR100でResNet50と同等の精度を達成しながら、メモリ使用量を元の38.5分の1にまで削減し、モデルサイズを38.5倍小さくした。
  • ImageNetでは、HFNがResNet34と同等の性能を示し、元のモデルと比較してメモリ使用量が26.8倍小さくなった。
  • 45nm CMOS推論アクセラレータ上では、DRAMからのモデルロードにかかるエネルギーコストが2桁低下した。これは、オフチップメモリアクセスを極限まで抑制できたためである。
  • 1枚のRTX 3090でHFNのスーパー・マスクをトレーニングするには1エポックあたり149秒を要したが、これは完全なResNet50の44秒と比較して、推論コストの大幅な削減とトレーニングコストのトレードオフを示している。
  • 本手法により、パラメータをオンチップSRAMに保存する専用ハードウェア上でのデプロイが可能となり、DRAMアクセスの必要がなくなり、ランダムシードとスパースなバイナリ・スーパー・マスクのみで構成される。
  • HFNは、極めて量子化された重みとバイナリ・スーパー・マスクを用いても性能が維持されるため、エネルギー効率が高く、低精度推論アクセラレータに最適である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。