[論文レビュー] Visual Prompting Upgrades Neural Network Sparsification: A Data-Model Perspective
本稿では、視覚的プロンプトと学習可能な重みマスクを共同最適化することで、ビジョンモデルにおけるニューラルネットワークスパース化を向上させる、データ・モデル共同設計フレームワークであるVPNを提案する。プロンプトとマスクを共同で訓練することで、複数のアーキテクチャおよびデータセットで最先端の精度を達成し、先行手法と比較して最大95%少ない学習エポック数で実現可能であり、優れたサブネットワークの転送可能性を示す。
The rapid development of large-scale deep learning models questions the affordability of hardware platforms, which necessitates the pruning to reduce their computational and memory footprints. Sparse neural networks as the product, have demonstrated numerous favorable benefits like low complexity, undamaged generalization, etc. Most of the prominent pruning strategies are invented from a model-centric perspective, focusing on searching and preserving crucial weights by analyzing network topologies. However, the role of data and its interplay with model-centric pruning has remained relatively unexplored. In this research, we introduce a novel data-model co-design perspective: to promote superior weight sparsity by learning important model topology and adequate input data in a synergetic manner. Specifically, customized Visual Prompts are mounted to upgrade neural Network sparsification in our proposed VPNs framework. As a pioneering effort, this paper conducts systematic investigations about the impact of different visual prompts on model pruning and suggests an effective joint optimization approach. Extensive experiments with 3 network architectures and 8 datasets evidence the substantial performance improvements from VPNs over existing start-of-the-art pruning algorithms. Furthermore, we find that subnetworks discovered by VPNs from pre-trained models enjoy better transferability across diverse downstream scenarios. These insights shed light on new promising possibilities of data-model co-designs for vision model sparsification.
研究の動機と目的
- ニューラルネットワークスパース化におけるデータの役割と、モデル中心の pruning との相互作用がまだ十分に探求されていないことに対処する。
- 視覚的プロンプトが、特に微調整後に適用された場合に、スパースビジョンモデルの性能を向上させられるかどうかを調査する。
- 視覚的プロンプトと重みマスクを共同で最適化する協調的設計パラダイムを構築し、高性能なスパースサブネットワークを発見する。
- 提案手法によって発見されたサブネットワークの効率性と転送可能性が、既存の pruning アルゴリズムと比較して向上していることを実証する。
提案手法
- スパース化プロセス中に視覚的プロンプトと微分可能な重みマスクを共同で訓練する、新しいデータ・モデル共同設計フレームワークであるVPNsを導入する。
- データレベルのインダクティブバイアスをスパース化プロセスに組み込むために、調整可能なパラメータを持つ特別な視覚的プロンプト(パッド、ランダム、固定)を設計する。
- 視覚的プロンプトとバイナリーマスクの両方がエンドツーエンドで更新されるように、共同最適化スキームを実装し、最適なスパースサブネットワークを同定する。
- 学習可能なプロンプト埋め込み空間を用いて、関連する入力領域に適応的に注目し、スパースモデルにおける特徴表現を強化する。
- 一般化性とロバスト性を評価するため、複数のアーキテクチャ(例:ResNet-18)およびデータセット(例:CIFAR-100、ImageNet)にこのフレームワークを適用する。
- 二段階の訓練プロセスを採用する:第一段階はプロンプトを用いたマスク探索、第二段階はプロンプトを用いたサブネットワークチューニングにより、段階的で洗練された最適化を実現する。
実験結果
リサーチクエスチョン
- RQ1微調整後に適用された場合でも、後処理の視覚的プロンプトがスパースビジョンモデルの性能を効果的に向上させられるか?
- RQ2パッド、ランダム、固定などの異なる視覚的プロンプト設計が、スパースサブネットワークの精度と収束に与える影響は何か?
- RQ3スパース化パイプラインにおいて、マスク探索段階とサブネットワークチューニング段階の両方で視覚的プロンプトが果たす相対的寄与度は何か?
- RQ4本手法によって発見されたサブネットワークは、多様な下流タスクおよびデータセットに一般化できる程度は何か?
- RQ5視覚的プロンプトと重みマスクの共同最適化により、性能を維持したまま、収束速度の向上と高いスパarsity化が達成可能か?
主な発見
- VPNsは、LTH、GraSP、HYDRAといった最先端の pruning メソッドを上回り、8つのデータセットおよび3つのアーキテクチャで高いテスト精度を達成した。
- 90%のスパarsityにおいて、VPNsはLTHに比べて95%少ないエポック数、GraSPに比べて50%少ないエポック数、HYDRAに比べて50%少ないエポック数を要し、優れた学習効率を示した。
- パッドプロンプト設計は、ランダムおよび固定プロンプトを常に上回り、パッドサイズが16のときに最良の性能を示したが、より大きなパッドサイズでは性能が低下した。
- VPNsによって発見されたサブネットワークは、異なるデータセット間で強い転送可能性を示し、下流アプリケーションにおける実用的価値を示した。
- VPNsはLTHに比べて26%、GraSPに比べて8.97%の学習時間を短縮したが、高いスパarsityを維持しながらGraSPと同等の時間消費量を維持した。
- アブレーションスタディにより、視覚的プロンプトがマスク探索段階よりもサブネットワークチューニング段階でより顕著な寄与を示すことが確認され、後段階でのプロンプト統合の重要性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。