Skip to main content
QUICK REVIEW

[論文レビュー] Model Spider: Learning to Rank Pre-Trained Models Efficiently

Yi-Kai Zhang, Ting-Ji Huang|arXiv (Cornell University)|Jun 6, 2023
Machine Learning and Data Classification被引用数 5
ひとこと要約

Model Spiderは、事前学習モデル(PTM)と下流タスクを意味的ベクトルにエンコードすることで、完全微調整を伴わずに高速な転移性推定が可能な、トークンベースで効率的な方法を提案する。この手法は、多様なベンチマークで高いランク付け精度を維持しながら、ベースライン手法に比べて最大1000倍の高速化を達成し、PTM選択分野で最先端の性能を発揮する。

ABSTRACT

Figuring out which Pre-Trained Model (PTM) from a model zoo fits the target task is essential to take advantage of plentiful model resources. With the availability of numerous heterogeneous PTMs from diverse fields, efficiently selecting the most suitable PTM is challenging due to the time-consuming costs of carrying out forward or backward passes over all PTMs. In this paper, we propose Model Spider, which tokenizes both PTMs and tasks by summarizing their characteristics into vectors to enable efficient PTM selection. By leveraging the approximated performance of PTMs on a separate set of training tasks, Model Spider learns to construct tokens and measure the fitness score between a model-task pair via their tokens. The ability to rank relevant PTMs higher than others generalizes to new tasks. With the top-ranked PTM candidates, we further learn to enrich task tokens with their PTM-specific semantics to re-rank the PTMs for better selection. Model Spider balances efficiency and selection ability, making PTM selection like a spider preying on a web. Model Spider demonstrates promising performance in various configurations of model zoos.

研究の動機と目的

  • 大規模で多様なモデルズーから最も転移性の高い事前学習モデル(PTM)を効率的に選択する課題に対処すること。
  • すべてのモデルに対して完全微調整を実施することで生じる計算コストを低減すること。
  • 未観測の下流タスクに対しても一般化可能な、汎用的なトークナイゼーションとランク付けメカニズムを学習すること。
  • 計算リソースの予算に応じて、効率性と正確性の間で柔軟なトレードオフを可能にすること。
  • 上位のPTMから得られるタスク固有の特徴を活用して初期ランクを精緻化することで、選択性能を向上させること。

提案手法

  • 一般エンコーダーを用いて、PTMとタスクを学習可能なベクトルトークンにエンコードし、それらの意味的・機能的特徴を捉える。
  • Transformerベースのモジュールを用いて、タスクトークンとPTMトークン間の類似度スコアを計算し、前方伝搬を伴わずに転移性を推定する。
  • 履歴的なタスク-PTMパフォーマンスデータに基づくランク集約を用いて、教師あり学習により、上位ランクのPTMトークンが対応するタスクトークンと一致するように訓練する。
  • 正確性の向上のため、候補モデルのサブセットに対して前方伝搬を実施し、PTM固有の特徴を抽出して上位PTMを再ランク付けする。
  • フレームワークは柔軟な予算トレードオフをサポート:最大の速度を求める場合は一般トークンのみを、より高い正確性を求める場合はPTM固有の特徴を追加する。
  • パイプライン全体がエンドツーエンド微分可能であり、トークナイゼーションとランク付けモジュールを同時に最適化可能である。

実験結果

リサーチクエスチョン

  • RQ1完全微調整を実施せずに、新しい下流タスクへの事前学習モデルの転移性を正確に予測できるか?
  • RQ2最小限の計算コストで、多様な事前学習モデルを含む大規模なモデルズーを効率的にランク付けできるか?
  • RQ3学習されたトークナイゼーションスキームは未観測のタスクに対しても一般化可能であり、多様なドメインで高いランク付け正確性を維持できるか?
  • RQ4PTM固有の特徴は選択正確性をどの程度向上させられるか?また、その向上と推論効率のトレードオフはどのようなものか?
  • RQ5提案手法は、前方伝搬に基づく既存の転移性プロキシと比較して、速度とランク付け性能の両面で優れているか?

主な発見

  • Model SpiderはImageNet-1Kで重み付き Kendall’s tau 相関係数 0.977を達成し、すべてのベースラインを大きく上回るランク付け正確性を示した。
  • PTMランク付けにかかる平均ウォールクロック時間を、完全微調整の600,000秒以上から、PTM固有の特徴を含まない状態でわずか52.36秒にまで短縮し、10,000倍の高速化を達成した。
  • 42個のPTM固有の特徴を用いる場合、推論時間は2,402.77秒にまで上昇するが、依然として完全微調整の250倍以上高速であった。
  • CIFAR-10、CUB-200、ImageNet-1Kを含む全18のデータセットで高い性能を維持しており、強力な一般化能力を示した。
  • アブレーションスタディの結果、一般トークナイゼーションとPTM固有の特徴強化の両方がランク付け性能に顕著な貢献をしていることが確認された。
  • Model Spiderのメモリフットプリントは、特徴なし状態で608 MBにとどまり、リソース制限のある環境への実装にも実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。