Skip to main content
QUICK REVIEW

[論文レビュー] Ranking and Tuning Pre-trained Models: A New Paradigm for Exploiting Model Hubs

Kaichao You, Yong Liu|arXiv (Cornell University)|Oct 20, 2021
Topic Modeling参考文献 87被引用数 11
ひとこと要約

本稿では、pre-trained model hubを活用するための新しいパラダイムを提案する。LogMEと呼ばれる計算的に効率的な転移可能性指標を導入し、ラベルの証拠推定に基づいてpre-trained model (PTM) を順位付けする。また、上位K個のPTMを一括でチューニングするためのベイジアン手法B-Tuningを提案する。このアプローチは、単純な選択や全範囲の微調整に比べて優れており、最小限の計算コストで多様なPTMアンサンブルにおいて最先端の性能を達成する。

ABSTRACT

Model hubs with many pre-trained models (PTMs) have become a cornerstone of deep learning. Although built at a high cost, they remain \emph{under-exploited} -- practitioners usually pick one PTM from the provided model hub by popularity and then fine-tune the PTM to solve the target task. This naïve but common practice poses two obstacles to full exploitation of pre-trained model hubs: first, the PTM selection by popularity has no optimality guarantee, and second, only one PTM is used while the remaining PTMs are ignored. An alternative might be to consider all possible combinations of PTMs and extensively fine-tune each combination, but this would not only be prohibitive computationally but may also lead to statistical over-fitting. In this paper, we propose a new paradigm for exploiting model hubs that is intermediate between these extremes. The paradigm is characterized by two aspects: (1) We use an evidence maximization procedure to estimate the maximum value of label evidence given features extracted by pre-trained models. This procedure can rank all the PTMs in a model hub for various types of PTMs and tasks \emph{before fine-tuning}. (2) The best ranked PTM can either be fine-tuned and deployed if we have no preference for the model's architecture or the target PTM can be tuned by the top $K$ ranked PTMs via a Bayesian procedure that we propose. This procedure, which we refer to as \emph{B-Tuning}, not only improves upon specialized methods designed for tuning homogeneous PTMs, but also applies to the challenging problem of tuning heterogeneous PTMs where it yields a new level of benchmark performance.

研究の動機と目的

  • pre-trained model hubの活用が不十分である現状(研究者が通常は最も人気のあるモデルのみを選択する)を是正すること。
  • 微調整を伴わずに、理論的裏付けがあり、計算効率の良い順位付け手法を提供することで、ナーバスなPTM選択の限界を克服すること。
  • 同種および異種の複数PTMの効果的チューニングを可能にし、単一モデルの微調整を上回る下流性能を向上させること。
  • 高価なハイパーパrameter探索やヘッド再訓練における過学習に依存しないようにし、統一的で統計的に妥当な指標に置き換えること。

提案手法

  • LogMEは、PTMからの特徴量とラベルの間の最大証拠の対数を推定し、微調整を要せず、転移可能性スコアを提供する。
  • 特徴量と事前知識に基づくラベルの予測分布を用いることで、多様なアーキテクチャとタスクにわたるPTMの順位付けが可能になる。
  • B-Tuningは、上位K個の順位付け済みPTMをベイジアンモデル平均法で統合し、一般化性能と性能の向上を図る一括チューニングを可能にする。
  • 閉形式解を有するガウス過程に類似したフレームワークを用いてラベル証拠をモデル化し、反復的最適化を回避する。
  • 後験予測分布を用いて転移可能性を推定することで、データが少ない状況下でも、精度ベースの指標よりもより頑健な性能を発揮する。
  • アーキテクチャに依存しない展開(上位順PTMによる利用)と、アーキテクチャ制約付きチューニング(上位KモデルのB-Tuning)の両方をサポートする。

実験結果

リサーチクエスチョン

  • RQ1微調整を伴わず、計算的に効率的な指標が、下流タスクへの転移可能性に基づいてpre-trained modelを順位付けできるか?
  • RQ2LogMEは、ブルートフォースな微調整や、LEEPやNCEといった既存の指標と比較して、順位付けの正確性において優れているか?
  • RQ3B-Tuningは、複数の異種pre-trained modelを効果的に統合し、個々の微調整を上回る性能を達成できるか?
  • RQ4提案されたパラダイムは、標準的なヘッド再訓練と比較して、過学習やハイパーパrameter感受性を低減できるか?
  • RQ5本手法は、視覚および自然言語処理のモデルを含む多様なタスクとPTMタイプに一般化可能か?

主な発見

  • ImageNet-1Kデータセットでは、LogMEが下流精度と0.86の相関を示し、LEEPやNCEを上回り、1回のヘッド再訓練に比べて1/3の時間で実行可能である。
  • Caltech-1000データセットでは、LogMEが微調整精度と0.81の相関を示したが、ハイパーパrameter探索を伴う全範囲のヘッド再訓練では、試行回数が増えるにつれて相関が低下し、過学習の兆候が見られた。
  • 低ショットセンチメント分類(SST-2)では、予測重みを仮想のアンカーキーワードとしてモデル化することで、LogMEが79.24%の精度を達成し、ヘッド再訓練(51.64%)や手動プロンプト選択(61.4%)を上回った。
  • B-Tuningは、異種PTMの組み合わせにおいて、Zoo-tuning や知識蒸留法を上回り、転移学習性能の新記録を樹立した。
  • 本手法は、ResNet、ViT、BERT、RoBERTaといったモデルを含む視覚および自然言語処理のタスクで一貫して優れた性能を示し、複数のデータセットで検証された。
  • 全範囲探索を回避することで計算コストを削減しながら、性能を維持または向上させたため、実世界の展開において実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。