Skip to main content
QUICK REVIEW

[論文レビュー] Parameter-Efficient Masking Networks

Yue Bai, Huan Wang|arXiv (Cornell University)|Oct 13, 2022
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

本稿では、深層ニューラルネットワークを表現するために、1つのランダム重みベクトルと学習可能なマスクを用いる、パラメータ効率的なマスキングネットワーク(PEMN)という新しいモデル圧縮パラダイムを提案する。固定されたランダム重みに対して、一意な値が限られた学習可能なマスクを学習させることで、モデルサイズを著しく削減しつつ高い性能を達成する。この手法は、複数のアーキテクチャにおいて、圧縮効率と耐障害性の面で従来手法を上回る。

ABSTRACT

A deeper network structure generally handles more complicated non-linearity and performs more competitively. Nowadays, advanced network designs often contain a large number of repetitive structures (e.g., Transformer). They empower the network capacity to a new level but also increase the model size inevitably, which is unfriendly to either model restoring or transferring. In this study, we are the first to investigate the representative potential of fixed random weights with limited unique values by learning diverse masks and introduce the Parameter-Efficient Masking Networks (PEMN). It also naturally leads to a new paradigm for model compression to diminish the model size. Concretely, motivated by the repetitive structures in modern neural networks, we utilize one random initialized layer, accompanied with different masks, to convey different feature mappings and represent repetitive network modules. Therefore, the model can be expressed as extit{one-layer} with a bunch of masks, which significantly reduce the model storage cost. Furthermore, we enhance our strategy by learning masks for a model filled by padding a given random weights vector. In this way, our method can further lower the space complexity, especially for models without many repetitive architectures. We validate the potential of PEMN learning masks on random weights with limited unique values and test its effectiveness for a new compression paradigm based on different network architectures. Code is available at https://github.com/yueb17/PEMN

研究の動機と目的

  • 固定されたランダム重みに一意な値が限られた場合に、学習可能なマスクを組み合わせることで、深層ニューラルネットワークがどの程度の代表的性能を示せるかを調査すること。
  • 特にモバイルデバイスや転移学習に適した展開を想定した場合に、深層ネットワークにおける高いモデルサイズという課題に対処すること。
  • スパース重みの保存をランダムベクトルと学習可能なマスクに置き換える、新しいネットワーク圧縮パラダイムを提案すること。
  • 繰り返し構造を持たないアーキテクチャを含む、多様なアーキテクチャに一般化可能な圧縮手法を構築すること。
  • 提案手法を用いることで、高い圧縮比下でもモデル性能が安定することを実証すること。

提案手法

  • 1層戦略を提案:1つのランダム初期化された層をプロトタイプとして用い、ネットワーク全体に異なるマスクを適用して複製する。
  • 構造的類似性を保つために、ネットワーク内で最もパラメータ数が多い層からパラメータを引き出して埋め込む「マックスレイヤーパディング(MP)」を導入する。
  • アーキテクチャ依存のない手法として、適切な長さの1つのランダムベクトルを用いて、すべての層を初期化する「ランダムベクトルパディング(RP)」を提案する。
  • バックプロパゲーションにより、タスク固有のバイナリまたは連続的マスクを学習し、固定されたランダム重み構造からサブネットワークを選択する。
  • 固定されたランダム重みベクトルと学習済みマスクの集合の組み合わせとして、完全なネットワークを表現することで、一意なパラメータ数を著しく削減する。
  • 従来のスパース重みの復元をマスクベースの再構成に置き換えることで、ストレージコストと転送コストを低減する。

実験結果

リサーチクエスチョン

  • RQ1一意な値が限られた固定ランダム重みベクトルに、学習可能なマスクを組み合わせた場合、最大でどの程度の代表的容量を有するか?
  • RQ2ランダム重みパディングにより一意なパラメータ数を最小限に抑えたニューラルネットワークが、マスク学習によって競争力のある性能を達成できるか?
  • RQ3従来のスパースネットワーク学習と比較して、提案されたPEMNベースの圧縮パラダイムは、圧縮比と精度のトレードオフにおいてどのように異なるか?
  • RQ4本手法は、繰り返し構造を持たない非反復的アーキテクチャを含め、さまざまなネットワークアーキテクチャにどの程度一般化可能か?
  • RQ5特に、より大きなベースラインモデルと比較して、極端な圧縮比下でも性能を維持できるか?

主な発見

  • 提案されたPEMN手法は、ResNet や ConvMixer を含む複数のアーキテクチャにおいて、従来手法よりも顕著に高い圧縮比を達成し、最先端の圧縮性能を実現した。
  • 従来のスパース学習とは異なり、圧縮比が上昇しても性能が急激に低下せず、PEMNは高い圧縮レベル下でも高い精度を維持するという耐障害性を示した。
  • PEMNを用いて圧縮した小型モデルは、従来のスパarsity手法で訓練されたより大きなベースラインモデルを上回る性能を示し、優れたパラメータ効率性を実証した。
  • 深層ネットワーク(例:ResNet56 対 ResNet32)では、圧縮モデルと密度モデルの性能差が小さくなる傾向にあり、深さに伴うスケーラビリティの向上が示された。
  • CIFAR-10 におけるConvMixerの実験では、PEMNはベースラインと比較して、より小さなモデルサイズでも高い精度を維持した。これは、異なるネットワーク設計においても有効性が確認されたことを示している。
  • ランダムベクトルパディングによるアーキテクチャに依存しない性質のおかげで、繰り返し構造を持たないネットワークに対しても広範な適用が可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。