Skip to main content
QUICK REVIEW

[論文レビュー] Parameter and Computation Efficient Transfer Learning for Vision-Language Pre-trained Models

Qiong Wu, Wei Yu|arXiv (Cornell University)|Sep 4, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、視覚言語事前学習モデル向けに、パラメータおよび計算効率の高い転移学習(PCETL)手法である動的アーキテクチャスキッピング(DAS)を提案する。DASは強化学習を用いて、推論時に不要なTransformerモジュールを特定しスキップする。同時に、特徴の適応に適した軽量アダプタを挿入することで、VQA2.0で性能を損なわず、推論速度を最大19.23%高速化し、FLOPsを11.97%削減する。

ABSTRACT

With ever increasing parameters and computation, vision-language pre-trained (VLP) models exhibit prohibitive expenditure in downstream task adaption. Recent endeavors mainly focus on parameter efficient transfer learning (PETL) for VLP models by only updating a small number of parameters. However, excessive computational overhead still plagues the application of VLPs. In this paper, we aim at parameter and computation efficient transfer learning (PCETL) for VLP models. In particular, PCETL not only needs to limit the number of trainable parameters in VLP models, but also to reduce the computational redundancy during inference, thus enabling a more efficient transfer. To approach this target, we propose a novel dynamic architecture skipping (DAS) approach towards effective PCETL. Instead of directly optimizing the intrinsic architectures of VLP models, DAS first observes the significances of their modules to downstream tasks via a reinforcement learning (RL) based process, and then skips the redundant ones with lightweight networks, i.e., adapters, according to the obtained rewards. In this case, the VLP model can well maintain the scale of trainable parameters while speeding up its inference on downstream tasks. To validate DAS, we apply it to two representative VLP models, namely ViLT and METER, and conduct extensive experiments on a bunch of VL tasks. The experimental results not only show the great advantages of DAS in reducing computational complexity, e.g. -11.97% FLOPs of METER on VQA2.0, but also confirm its competitiveness against existing PETL methods in terms of parameter scale and performance. Our source code is given in our appendix.

研究の動機と目的

  • 既存のパラメータ効率の良い転移学習(PETL)手法があるにもかかわらず、大規模な視覚言語事前学習(VLP)モデルを下流タスクで微調整する際の高い計算コストに対処すること。
  • 事前学習済みVLPモデル内の不要なモジュールを特定し、スキップすることで、推論時のパラメータおよび計算負荷を低減すること。
  • タスク固有のモジュール重要度に基づく動的サブネットワークルーティングにより、性能を維持したまま推論を大幅に高速化すること。
  • 現在のPETLアプローチの限界を克服し、パラメータ効率的かつ計算効率的な効果的な転移学習を実現すること。

提案手法

  • DASは、モジュールスキッピングをk腕バンディット問題として定式化し、強化学習(RL)を用いて、下流タスクにおける各視覚言語(VL)モジュールの重要度を評価する。
  • RLエージェントは累積報酬に基づき、どのTransformer層をスキップするかを決定し、推論時に最適なサブネットワークに動的にルーティングする。
  • 不要なモジュールは、特徴適応能力を保ちつつ計算量を削減するため、軽量アダプタとスキップ接続に置き換える。
  • この手法は、PETL手法と同等の固定されたトレーニング可能なパラメータ数を維持するため、パラメータ効率性を確保する。
  • DASは事前学習後に行われるため、再トレーニングやアーキテクチャの再設計を回避でき、すでに十分に事前学習済みのVLPモデルにも適用可能である。
  • 探索プロセスは、モジュールの冗長性推定に基づく報酬関数によって誘導され、結果は可視化され、タスク固有のルーティングパターンを確認できる。

実験結果

リサーチクエスチョン

  • RQ1動的アーキテクチャスキッピング機構は、推論時に視覚言語事前学習モデルにおける計算の冗長性を低減できるか?
  • RQ2DASは、既存のPETL手法と比較して、パラメータ効率性および推論速度の面で優れているか?
  • RQ3DASは、視覚言語タスクにおける競争力ある精度を維持したまま、FLOPsをどれほど削減し、推論をどれほど高速化できるか?
  • RQ4モジュールスキッピングにおけるタスク固有のパターンは何か?また、それらは異なるVLタスクの意味的要件をどのように反映しているか?

主な発見

  • DASは、VQA2.0タスクにおいてMETERでFLOPsを11.97%削減し、顕著な計算コストの削減を実証した。
  • DASは、フル微調整と比較して推論速度を19.23%向上させ、推論効率において標準的なPETL手法をも上回った。
  • 3つの視覚言語タスクにおいて、DASは計算負荷を低減しながらも、競争力ある性能を維持した。これは、PCETLにおける有効性を裏付けた。
  • RLベースのモジュール選択プロセスは、訓練の初期段階で不要なレイヤーを効果的に同定でき、冗長性推定値は振動の後、安定した。
  • タスク固有のサブネットワークが同定された:VQAでは中間レベルの言語モジュールのスキップが好まれるが、NLVRでは上位レベルの言語レイヤーのスキップが好まれる。これはタスクの意味的特性を反映している。
  • DASは、パラメータ効率性と計算効率性の良好なトレードオフを達成した。これは、フルモデルを上回る推論速度を実現する唯一のPETL手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。