[論文レビュー] VMT-Adapter: Parameter-Efficient Transfer Learning for Multi-Task Dense Scene Understanding
本稿では、複数の密度予測タスクに適応するパラメータ効率の良い転移学習手法VMT-Adapterを提案する。タスク数に関係なく近似的に$O(1)$のトレーニングおよび推論コストを達成するため、タスク間で投影を共有し、軽量なタスク固有の知識抽出モジュールを用いる。単一タスクのフルファインチューニングに比べ3.96%の相対的改善を達成しながら、事前学習モデルの可学習パラメータの約1%しか使用せず、VMT-Adapter-Liteではパラメータを0.36%まで削減する。
Large-scale pre-trained models have achieved remarkable success in various computer vision tasks. A standard approach to leverage these models is to fine-tune all model parameters for downstream tasks, which poses challenges in terms of computational and storage costs. Recently, inspired by Natural Language Processing (NLP), parameter-efficient transfer learning has been successfully applied to vision tasks. However, most existing techniques primarily focus on single-task adaptation, and despite limited research on multi-task adaptation, these methods often exhibit suboptimal training and inference efficiency. In this paper, we first propose an once-for-all Vision Multi-Task Adapter (VMT-Adapter), which strikes approximately O(1) training and inference efficiency w.r.t task number. Concretely, VMT-Adapter shares the knowledge from multiple tasks to enhance cross-task interaction while preserves task-specific knowledge via independent knowledge extraction modules. Notably, since task-specific modules require few parameters, VMT-Adapter can handle an arbitrary number of tasks with a negligible increase of trainable parameters. We also propose VMT-Adapter-Lite, which further reduces the trainable parameters by learning shared parameters between down- and up-projections. Extensive experiments on four dense scene understanding tasks demonstrate the superiority of VMT-Adapter(-Lite), achieving a 3.96%(1.34%) relative improvement compared to single-task full fine-tuning, while utilizing merely ~1% (0.36%) trainable parameters of the pre-trained model.
研究の動機と目的
- 大規模な事前学習済みビジョンモデルを複数の密度予測タスクに適用する際の高い計算コストおよびストレージコストを低減すること。
- 既存のパラメータ効率の良い手法が、トレーニングおよび推論においてタスク数に比例して非効率になる問題を克服すること。
- 統一的かつスケーラブルなフレームワーク内で、タスク固有の表現を保持しつつ、効果的なクロスタスク知識の共有を実現すること。
- 特にマルチタスク設定において、パフォーマンスを損なわずに可学習パラメータを顕著に削減すること。
- 異なるバックボーンアーキテクチャおよびデコーダ構造に対応できる柔軟な手法の開発
提案手法
- VMT-Adapterは、タスク数に依存しない共有投影を導入し、タスク数に対して$O(1)$のトレーニングおよび推論コストスケーリングを実現する。
- 個々のタスクの表現を保持するため、最小限のパラメータを有するタスク固有の知識抽出モジュールを採用する。
- 任意のトランスフォーマーの中間層に統合可能であり、タスク汎用的およびタスク固有の特徴の統合学習を可能にする。
- VMT-Adapter-Liteでは、アダプタモジュール内のダウンプロジェクション行列とアッププロジェクション行列の間に学習可能な重みを共有することで、さらにパラメータを削減する。
- アダプタはトランスフォーマーのエンコーダおよびデコーダの複数の層に適用され、マルチスケール特徴の適応を可能にする。
- フレームワークは、セマンティックセグメンテーション、表面法線推定、サルイエンシー検出、深度推定の4つの密度推定タスクで評価される。
実験結果
リサーチクエスチョン
- RQ1パラメータ効率の良い手法が、複数の密度推定タスクにおいて高い性能を発揮しつつ、低コストなトレーニングおよび推論を実現できるか?
- RQ2タスク固有の表現学習を損なわず、効果的なクロスタスク知識共有を実現する方法は何か?
- RQ3フルモデルの1%未満の可学習パラメータで、フルファインチューニングを上回る性能を達成できるか?
- RQ4アダプタ内のダウンプロジェクションとアッププロジェクションの間でパラメータを共有することで、モデルサイズを顕著に削減できるか?また、パフォーマンス低下は最小限か?
- RQ5異なるバックボーンアーキテクチャおよびデコーダ設計に対して、本手法はどのように一般化するか?
主な発見
- VMT-Adapterは、4つの密度推定タスクにおいて、単一タスクのフルファインチューニングに比べ3.96%の相対的改善を達成し、可学習パラメータは113万(フルモデルの約1%)に留める。
- VMT-Adapter-Liteは、可学習パラメータを40万(フルモデルの0.36%)に削減しながらも、フルファインチューニングに比べ1.34%の相対的改善を達成する。
- パラメータが著しく少ないにもかかわらず、強力なベースライン手法であるPolyhistor(+2.34%の改善)およびHyperformer(+2.64%)を上回る性能を発揮する。
- VMT-Adapterは異なるバックボーンに対しても良好に一般化する:SwinTransformer-Baseでは平均で+7.10%の改善を達成し、フルファインチューニングを上回る。
- HRNet-V2のハイレゾデコーダを含むさまざまなデコーダに対しても、+2.41%の相対的改善を示し、強力な性能を維持する。
- アブレーションスタディの結果、ダウンプロジェクション比(ρ)を高めるほど性能が向上し、ρ=8が最良の性能を示す。また、VMT-Adapter-Liteにおいてm=3を設定すると、パラメータと精度の最良のトレードオフが達成される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。