Skip to main content
QUICK REVIEW

[論文レビュー] Polyhistor: Parameter-Efficient Multi-Task Adaptation for Dense Vision Tasks

Yen‐Cheng Liu, Chih‐Yao Ma|arXiv (Cornell University)|Oct 7, 2022
Multimodal Machine Learning Applications被引用数 15
ひとこと要約

Polyhistor および Polyhistor-Lite は、ビジョントランスフォーマーを用いた密度的なビジョンタスクのためのパラメータ効率の良いマルチタスク適応手法であり、パラメータを最大90%まで削減する「分解型ハイパーネットワーク」と「レイヤーごとのスケーリングカーネル」を導入することで、フル微調整性能を同等または上回る性能を達成する。本手法は、先行手法に比べてわずか約10%のパラメータで最先端の精度を達成する。

ABSTRACT

Adapting large-scale pretrained models to various downstream tasks via fine-tuning is a standard method in machine learning. Recently, parameter-efficient fine-tuning methods show promise in adapting a pretrained model to different tasks while training only a few parameters. Despite their success, most existing methods are proposed in Natural Language Processing tasks with language Transformers, and adaptation to Computer Vision tasks with Vision Transformers remains under-explored, especially for dense vision tasks. Further, in multi-task settings, individually fine-tuning and storing separate models for different tasks is inefficient. In this work, we provide an extensive multi-task parameter-efficient benchmark and examine existing parameter-efficient fine-tuning NLP methods for vision tasks. Our results on four different dense vision tasks showed that existing methods cannot be efficiently integrated due to the hierarchical nature of the Hierarchical Vision Transformers. To overcome this issue, we propose Polyhistor and Polyhistor-Lite, consisting of Decomposed HyperNetworks and Layer-wise Scaling Kernels, to share information across different tasks with a few trainable parameters. This leads to favorable performance improvements against existing parameter-efficient methods while using fewer trainable parameters. Specifically, Polyhistor achieves competitive accuracy compared to the state-of-the-art while only using ~10% of their trainable parameters. Furthermore, our methods show larger performance gains when large networks and more pretraining data are used.

研究の動機と目的

  • 階層的なビジョントランスフォーマーを用いた密度的ビジョンタスクにおける、従来のパラメータ効率の良い微調整手法の非効率性を解消すること。
  • マルチタスク密度的ビジョンベンチマークに適用した際のアダプタベースおよびハイパーネットワークベース手法の限界を克服すること。
  • 複数の密度的ビジョンタスク間で知識を共有しながら、トレーニング可能なパラメータを最小限に抑える統合的かつパラメータ効率の良いフレームワークを設計すること。
  • モデルサイズや事前学習データのスケールに応じた、パラメータ効率の良い手法のスケーラビリティと性能を評価すること。
  • より大きなモデルやより多くの事前学習データが、提案手法の性能向上に寄与することを示すこと。

提案手法

  • 単一の大規模ハイパーネットワークを2つのより小さな低ランクハイパーネットワークに分割する「分解型ライトハイパーネットワーク」を提案し、アダプタ重みの生成を効率化することで、パラメータ数を削減しながら性能を維持する。
  • アダプタ重み行列をクリプトニアン積を用いて「テンプレートカーネル」と「サイズ制御可能なスケーリングカーネル」に因子分解する「レイヤーごとのスケーリングカーネル」を導入し、階層的ビジョントランスフォーマーにおけるレイヤー間でのパラメータ共有を可能にする。
  • すべてのレイヤーに共通するテンプレートカーネルを採用し、レイヤーの特徴次元に応じてスケーリングカーネルのサイズを調整することで、パラメータ数を増加させることなく効率的な適応を実現する。
  • タスク固有の埋め込みを用いてハイパーネットワークを条件づけることで、各タスクに固有の適応パスを提供しながらも、コアとなるパラメータ効率の良いメカニズムを共有する。
  • スウィントランスフォーマーに基づくモデルに本手法を適用し、セマンティックセグメンテーション、インスタンスセグメンテーション、サリエンシープレディクション、ノーマル推定の4つのタスクを同時に微調整可能にし、最小限のパラメータ更新で実現する。
  • 一貫したトレーニングおよび評価プロトコルを備えた統合ベンチマークフレームワークを構築し、NLPベースのパラメータ効率の良い手法と、密度的ビジョンタスクにおいて公平に比較可能にする。

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーを用いた密度的ビジョンタスクに、既存のNLPベースのパラメータ効率の良い微調整手法を効果的に適用できるか?
  • RQ2なぜアダプタベースおよびハイパーネットワークベース手法は、階層的ビジョントランスフォーマーを用いたマルチタスク学習において効率的にスケーリングできないのか?
  • RQ3パフォーマンスを損なわずに、マルチタスクビジョン適応におけるトレーニング可能なパラメータ数をどのように削減できるか?
  • RQ4パラメータ効率の良い手法の性能向上は、モデルサイズや事前学習データサイズの増大に伴って拡大するか?
  • RQ5タスク間で共有される統合的かつ共通の適応メカニズムは、より少ないパラメータでタスク固有の微調整を上回る性能を達成できるか?

主な発見

  • Polyhistor-Lite は、ImageNet-1k で事前学習された Swin-Tiny モデルにおいて、1.74% の平均精度向上を達成しながら、わずか 0.41M 個のトレーニング可能なパラメータ(全モデルの 0.36%)を用いる。
  • 本手法は、はるかに多くのパラメータを必要とする最先端のマルチタスクパラメータ効率の良い手法を上回り、約10%のトレーニングパラメータで競争力のある性能を達成する。
  • モデルサイズの増大に伴い性能向上が顕著に現れる:Swin-Base では Swin-Tiny よりも顕著な改善が観察され、モデルサイズに応じたスケーラビリティが裏付けられる。
  • ImageNet-22k で事前学習されたモデルは、ImageNet-1k で事前学習されたモデルよりも大きな性能向上を示し、同じ性能に達するためのトレーニングパラメータ数も少ない。
  • タスク埋め込み次元を大きく(最大64)することで、平均的なパフォーマンス向上が向上し、k=64 を用いることでフル微調整を1.74%上回る。
  • 本手法は、セマンティックセグメンテーション、インスタンスセグメンテーション、サリエンシープレディクション、ノーマル推定という多様な密度的ビジョンタスクにおいても高い性能を維持し、広範な適用可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。