Skip to main content
QUICK REVIEW

[論文レビュー] Finetune like you pretrain: Improved finetuning of zero-shot vision models

Sachin Goyal, Ananya Kumar|arXiv (Cornell University)|Dec 1, 2022
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、CLIPのようなゼロショットビジョンモデルのファインチューニングに、事前学習時と同一の対照的損失(contrastive loss)をファインチューニング時にも使用する、シンプルで非常に効果的な手法であるFinetune Like You Pretrain(FLYP)を提案する。クラスラベルをテキストプロンプトとして扱い、画像埋め込みとプロンプト埋め込みの間で対照的損失を最適化することで、16のベンチマークで最先端の性能を達成し、少データ学習では最大4.6%、OOD一般化では最大2.7%の向上を達成した。

ABSTRACT

Finetuning image-text models such as CLIP achieves state-of-the-art accuracies on a variety of benchmarks. However, recent works like WiseFT (Wortsman et al., 2021) and LP-FT (Kumar et al., 2022) have shown that even subtle differences in the finetuning process can lead to surprisingly large differences in the final performance, both for in-distribution (ID) and out-of-distribution (OOD) data. In this work, we show that a natural and simple approach of mimicking contrastive pretraining consistently outperforms alternative finetuning approaches. Specifically, we cast downstream class labels as text prompts and continue optimizing the contrastive loss between image embeddings and class-descriptive prompt embeddings (contrastive finetuning). Our method consistently outperforms baselines across 7 distribution shifts, 6 transfer learning, and 3 few-shot learning benchmarks. On WILDS-iWILDCam, our proposed approach FLYP outperforms the top of the leaderboard by $2.3\%$ ID and $2.7\%$ OOD, giving the highest reported accuracy. Averaged across 7 OOD datasets (2 WILDS and 5 ImageNet associated shifts), FLYP gives gains of $4.2\%$ OOD over standard finetuning and outperforms the current state of the art (LP-FT) by more than $1\%$ both ID and OOD. Similarly, on 3 few-shot learning benchmarks, our approach gives gains up to $4.6\%$ over standard finetuning and $4.4\%$ over the state of the art. In total, these benchmarks establish contrastive finetuning as a simple, intuitive, and state-of-the-art approach for supervised finetuning of image-text models like CLIP. Code is available at https://github.com/locuslab/FLYP.

研究の動機と目的

  • ファインチューニングされたビジョン・ランゲージモデルにおける分布内と分布外一般化の性能ギャップを是正すること。
  • 事前学習の目的関数と同一のファインチューニング目的関数を採用することで、ロバストネスと精度が向上するかどうかを調査すること。
  • ファインチューニング時に対照的損失を用いるという最小限で直感的なアプローチが、複雑なマルチステージまたはアンサンブルベースのベースラインを上回るかどうかを評価すること。
  • 対照的ファインチューニングが、ゼロショットビジョンモデルの教師ありファインチューニングにおける新しい標準ベースラインとして確立されることを示し、一貫した優位性を示すこと。
  • ラベル付きデータが限られる状況である少データ学習や分布シフト設定において、このアプローチの有効性を検討すること。

提案手法

  • 各クラスラベルを自然言語プロンプトとして表現する(例:'{クラス}の写真' とし、事前学習時のプロンプトスタイルを再現する)。
  • 画像エンコーダーを用いて入力画像を埋め込み、テキストエンコーダーを用いてクラス記述プロンプトを埋め込む。
  • 画像埋め込みと対応するプロンプト埋め込みの間で対照的損失を最適化し、事前学習の目的を再現する。
  • 交差エントロピーヘッドや追加の正則化を一切用いずに、対照的損失のみでエンドツーエンドのファインチューニングを実行する。
  • 標準的な最適化法(例:AdamW)を用い、学習率スケジューリングとともに、ダウンストリームデータセットでモデルを学習する。
  • ファインチューニング時にも、事前学習時と同一の損失関数を適用し、最適化目的の整合性を確保する。
Figure 1 : Finetune Like You Pretrain (FLYP ): Given a downstream classification dataset, standard finetuning approaches revolve around using the cross-entropy loss. In this work, we show that simply using the same loss as the pretraining i.e. contrastive loss, with “task supervision” coming from th
Figure 1 : Finetune Like You Pretrain (FLYP ): Given a downstream classification dataset, standard finetuning approaches revolve around using the cross-entropy loss. In this work, we show that simply using the same loss as the pretraining i.e. contrastive loss, with “task supervision” coming from th

実験結果

リサーチクエスチョン

  • RQ1事前学習時と同一の対照的損失をファインチューニング時に使用することで、標準的な交差エントロピーによるファインチューニングよりも性能が向上するか?
  • RQ2単一で統一された目的関数(対照的損失)が、LP-FT やアンサンブル戦略といった複雑なマルチステージファインチューニング手法を上回るか?
  • RQ3FLYPは、SOTA手法と比較して、分布外一般化ベンチマークでどの程度の性能を示すか?
  • RQ4対照的ファインチューニングアプローチは、ラベル付きデータが限られる少データ学習シナリオに効果的にスケーリングできるか?
  • RQ5なぜ、正則化や重みアンサンブルを含むより洗練されたベースラインよりも、単純な対照的ファインチューニングアプローチが優れているのか?

主な発見

  • WILDS-iWildCamで、FLYPはリーダーボード上位(ModelSoups、70以上のアンサンブルモデル)をCLIP ViT-L/14@336pxを用いて、分布内では2.3%、分布外では2.7%上回る精度を達成した。
  • 7つのOODベンチマーク(2つのWILDSと5つのImageNet shifts)において、FLYPは標準的なファインチューニングより4.2%高いOOD精度を達成し、IDおよびOOD両方でLP-FTより1%以上高い精度を示した。
  • 少データ学習では、FLYPは標準的なファインチューニングより最大4.6%、SOTA(LP-FT)より4.4%の精度向上を達成した。代表的な二値分類タスク(例:Rendered-SST2 や PatchCamelyon)で顕著だった。
  • FLYPは、ベンチマーク全体にわたり、ID-OODフロンティア曲線を一貫して支配しており、分布内性能とロバストネスのトレードオフが優れていることを示している。
  • FLYPに交差エントロピー損失を追加すると性能が低下し、対照的目的関数のみで十分で最適であることが示された。
  • この手法はシンプルで直感的であり、アーキテクチャの変更やハイパーパramータチューニング、アンサンブルを一切必要としないが、多様な設定でSOTA結果を達成している。
(a) OpenAI CLIP ViT-B/16 finetuned on ImageNet
(a) OpenAI CLIP ViT-B/16 finetuned on ImageNet

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。