Skip to main content
QUICK REVIEW

[論文レビュー] UPop: Unified and Progressive Pruning for Compressing Vision-Language Transformers

Dachuan Shi, Chaofan Tao|arXiv (Cornell University)|Jan 31, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

UPopは、視覚・言語トランスフォーマーを圧縮するための統合的で段階的な pruning フレームワークであり、連続最適化を通じて視覚、言語、クロスアテンション部品の間で自動的・適応的に pruning 確率を割り当て可能にするとともに、段階的再訓練により収束性と性能向上を確保する。画像分類、キャプション生成、セグメンテーションのタスクにおいて最大2倍の圧縮が可能であり、性能低下は1%未満に抑えられる。

ABSTRACT

Real-world data contains a vast amount of multimodal information, among which vision and language are the two most representative modalities. Moreover, increasingly heavier models, extit{e}. extit{g}., Transformers, have attracted the attention of researchers to model compression. However, how to compress multimodal models, especially vison-language Transformers, is still under-explored. This paper proposes the extbf{U}nified and extbf{P}r extbf{o}gressive extbf{P}runing ( extbf{\emph{UPop}}) as a universal vison-language Transformer compression framework, which incorporates 1) unifiedly searching multimodal subnets in a continuous optimization space from the original model, which enables automatic assignment of pruning ratios among compressible modalities and structures; 2) progressively searching and retraining the subnet, which maintains convergence between the search and retrain to attain higher compression ratios. Experiments on various tasks, datasets, and model architectures demonstrate the effectiveness and versatility of the proposed UPop framework. The code is available at https://github.com/sdc17/UPop.

研究の動機と目的

  • 視覚・言語トランスフォーマーはますます巨大化・リソース集約的であるが、そのようなモデルに対して効果的で体系的な圧縮手法が不足していることに対処する。
  • マルチモーダルな pruning における手動による pruning 確率の割り当ての非効率性と非最適性を克服する。
  • 段階的探索と再訓練を通じて、収束性と性能を維持しつつ、高い圧縮比を達成する。
  • 多様な視覚・言語タスク、データセット、モデルアーキテクチャに適用可能な汎用フレームワークを提供する。
  • 異なるモダリティや構造(例:自己アテンション、フィードフォワードネットワーク)に自動的に pruning 確率を割り当てることで、損失なしまたは近似損失なしの圧縮を実現する。

提案手法

  • 視覚、言語、クロスアテンション部品の間で、同時に pruning 確率を探索できる統合的探索空間を連続最適化によって提案する。
  • 正則化を施した学習可能なマスク($\bm{\zeta}$)を導入し、微分可能 pruning を実現することで、勾配ベースの pruning 確率最適化を可能にする。
  • 段階的 pruning パラダイムを採用:まず連続空間内でサブネットワークを探索し、次に微調整された重みで再訓練することで性能ギャップを埋める。
  • 二段階の訓練スキームを用いる:探索段階では学習率$\alpha$、再訓練段階では学習率$\beta$を適用し、収束を安定化させる。
  • 全体のモデルサイズを制御する総合的圧縮比$p$を導入し、部品ごとの pruning 確率をエンドツーエンドで決定する。
  • 視覚と言語のブランチ、ならびにクロスアテンションモジュールを統合的に扱うことで、マルチモーダルタスクへの適用を拡張する。

実験結果

リサーチクエスチョン

  • RQ1視覚・言語トランスフォーマーにおいて、統合的で連続的最適化フレームワークは、視覚、言語、クロスアテンション部品の間で最適な pruning 確率を自動的に割り当てられるか?
  • RQ2特に高い圧縮比において、段階的再訓練は、標準的なワンショット pruning と比較して収束性と性能を向上させるか?
  • RQ3マルチモーダルタスクにおいて、UPopは従来の単モーダル pruning ベースライン(例:ViT-Slimming)と比較して、精度と圧縮効率の両面で優れているか?
  • RQ4UPopは、多様な視覚・言語タスクにおいて、高い圧縮比(例:2倍)で近似損失なし(≤1%精度低下)の圧縮を達成できるか?
  • RQ5異なるタスク(例:画像分類 vs. 画像セグメンテーション)において、冗長性の程度が異なる条件下で、UPopの性能はどのように変化するか?

主な発見

  • DeiTにおいてUPopは最大2倍の圧縮(1140万パラメータ)を達成し、トップ1精度はわずか1.0%低下に抑えられ、同程度の圧縮レベルにおけるベースライン手法を上回る性能を示した。
  • 画像分類タスクでは、1.11倍の圧縮(1990万パラメータ)でトップ1精度81.1を維持し、元のDeiTと比較して1.2%の向上を達成した。
  • ADE20kセグメンテーションタスクでは、1.1倍の圧縮でmIoUが0.6%向上(45.9 vs. 45.3)し、FLOPsも13%削減され、ベースラインを上回った。
  • 1.42倍の圧縮においても、トップ1精度は80.2(0.3%低下)を維持し、FLOPsは30%削減され、高い圧縮比でも強力な性能を示した。
  • 画像分類タスクでは1.5倍の損失なし圧縮を達成し、セグメンテーションタスクでは1.4倍の圧縮でmIoU損失が1%未満(<1%)に抑えられたことから、分類タスクの方がより高い圧縮可能性を示した。
  • 段階的再訓練スキームは収束性を顕著に向上させ、標準的な pruning 手法とは異なり、性能劣化を伴わずに高い圧縮比を達成可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。