Skip to main content
QUICK REVIEW

[論文レビュー] MiniViT: Compressing Vision Transformers with Weight Multiplexing

Jinnian Zhang, Houwen Peng|arXiv (Cornell University)|Apr 14, 2022
CCD and CMOS Imaging Sensors被引用数 8
ひとこと要約

MiniViTは、重み多重化(重み変換と知識蒸留を組み合わせる)を用いたビジョン変換器のための新規圧縮フレームワークを提案する。モデルサイズを縮小しながら精度を向上させる。ImageNet上でスウィン・ビー(Swin-B)を48%パラメータ削減し、トップ1精度を1.0%向上させ、DeiT-Bを9.7倍(86Mから9Mパラメータ)に圧縮しながら性能の低下を最小限に抑える。

ABSTRACT

Vision Transformer (ViT) models have recently drawn much attention in computer vision due to their high model capability. However, ViT models suffer from huge number of parameters, restricting their applicability on devices with limited memory. To alleviate this problem, we propose MiniViT, a new compression framework, which achieves parameter reduction in vision transformers while retaining the same performance. The central idea of MiniViT is to multiplex the weights of consecutive transformer blocks. More specifically, we make the weights shared across layers, while imposing a transformation on the weights to increase diversity. Weight distillation over self-attention is also applied to transfer knowledge from large-scale ViT models to weight-multiplexed compact models. Comprehensive experiments demonstrate the efficacy of MiniViT, showing that it can reduce the size of the pre-trained Swin-B transformer by 48\%, while achieving an increase of 1.0\% in Top-1 accuracy on ImageNet. Moreover, using a single-layer of parameters, MiniViT is able to compress DeiT-B by 9.7 times from 86M to 9M parameters, without seriously compromising the performance. Finally, we verify the transferability of MiniViT by reporting its performance on downstream benchmarks. Code and models are available at here.

研究の動機と目的

  • リソース制約のあるデバイスへの展開を制限するビジョン変換器(ViTs)の大きなパラメータ数の課題に対処すること。
  • ビジョン変換器における単純な層間重み共有が引き起こす学習不安定性と性能低下を克服すること。
  • 同型および階層的ViTアーキテクチャの両方に効果的な汎用的圧縮フレームワークの開発。
  • 高い圧縮比であってもモデル性能を損なわず、パラメータ効率を向上させること。
  • 下流のビジョンタスク(例:オブジェクト検出やセグメンテーション)への圧縮モデルの転移性を可能にすること。

提案手法

  • 重み多重化を導入し、変換層ごとの線形変換を適用することで、変換器ブロック間で重みを共有しながら重みの多様性を高める。
  • 各共有層の多頭部自己注意(MSA)および多層パーセプトロン(MLP)モジュールに別々の変換行列を適用し、同一の重み更新を避ける。
  • 層間で層正則化パラメータを分離することで、安定した特徴統計を維持し、学習安定性を向上させる。
  • 予測レベル、注目度レベル、隠れ状態レベルの多段階知識蒸留を実装し、大規模な教師モデルからコンパクトな生徒モデルへ知識を転送する。
  • 1つの層のパラメータセットで全共有層を表現することで、モデルサイズを著しく削減しながら性能を保持する。
  • 下流タスクでの性能向上を図るため、検出蒸留を用いて圧縮モデルを微調整する。

実験結果

リサーチクエスチョン

  • RQ1単純な層間重み共有をビジョン変換器に適用しても、学習不安定性や性能低下を引き起こさずに効果的に適用可能か?
  • RQ2ビジョン変換器ブロック間で重みを共有する際、どのようなメカニズムが学習を安定化させ、性能を維持するか?
  • RQ3予測、注目度、隠れ状態の多段階知識蒸留は、精度を保持しつつビジョン変換器の圧縮にどの程度有効か?
  • RQ4提案手法を用いることで、同型および階層的ViTアーキテクチャの両方でどの程度のパラメータ削減が達成可能か?
  • RQ5圧縮されたMiniViTモデルは、オブジェクト検出やセグメンテーションなどの下流ビジョンタスクへの転移性を保持しているか?

主な発見

  • MiniViTは、事前学習済みのスウィン・ビー(Swin-B)のパラメータ数を48%削減しながら、ImageNetのトップ1精度を1.0%向上させた。
  • 本手法により、DeiT-Bのパラメータ数は8600万から900万に圧縮され(9.7倍圧縮)、性能の低下はわずかであった。
  • 変換と蒸留を組み合わせた重み多重化は、単純な重み共有とは異なり、学習を安定化させ、崩壊を防ぐ。
  • 注目度レベルおよび隠れ状態レベルの蒸留は、特に微調整段階で検出蒸留と組み合わせることで、性能向上に顕著に寄与した。
  • MiniViTは、バックボーンで57%のパラメータ削減を達成しながら、COCOオブジェクト検出タスクでベースラインと同等の平均適合率(AP)を維持した。
  • 圧縮モデルは優れた転移性を示し、微調整後に下流の検出およびセグメンテーションベンチマークで最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。