Skip to main content
QUICK REVIEW

[論文レビュー] CLIP Itself is a Strong Fine-tuner: Achieving 85.7% and 88.0% Top-1 Accuracy with ViT-B and ViT-L on ImageNet

Xiaoyi Dong, Jianmin Bao|arXiv (Cornell University)|Dec 12, 2022
Domain Adaptation and Few-Shot Learning被引用数 16
ひとこと要約

この論文は、CLIPを洗練された最適化されたハイパーパrameter戦略で微調整した場合、ImageNet-1Kで最先端の性能を達成することを示している。ViT-BaseおよびViT-Largeバックボーンを用いた場合、それぞれ85.7%および88.0%のトップ1正答率を達成し、CLIPが微調整に不適切であるという考えを覆し、視覚表現学習の強力なベースラインを確立している。

ABSTRACT

Recent studies have shown that CLIP has achieved remarkable success in performing zero-shot inference while its fine-tuning performance is not satisfactory. In this paper, we identify that fine-tuning performance is significantly impacted by hyper-parameter choices. We examine various key hyper-parameters and empirically evaluate their impact in fine-tuning CLIP for classification tasks through a comprehensive study. We find that the fine-tuning performance of CLIP is substantially underestimated. Equipped with hyper-parameter refinement, we demonstrate CLIP itself is better or at least competitive in fine-tuning compared with large-scale supervised pre-training approaches or latest works that use CLIP as prediction targets in Masked Image Modeling. Specifically, CLIP ViT-Base/16 and CLIP ViT-Large/14 can achieve 85.7%,88.0% finetuning Top-1 accuracy on the ImageNet-1K dataset . These observations challenge the conventional conclusion that CLIP is not suitable for fine-tuning, and motivate us to rethink recently proposed improvements based on CLIP. We will release our code publicly at \url{https://github.com/LightDXY/FT-CLIP}.

研究の動機と目的

  • CLIPの微調整性能が、最適でないハイパーパrameter選択によって低く評価されているかどうかを調査すること。
  • ImageNet-1KにおけるCLIPの微調整精度を最大化する包括的なハイパーパrameter設定を同定・検証すること。
  • 微調整設定において、教師あり事前学習やCLIP蒸留手法と競合可能な、CLIP自体を強力な代替手段として確立すること。
  • 今後のCLIPベースの視覚モデル研究のための再現可能で高精度なベースラインを提供すること。

提案手法

  • 最適化されたハイパーパrameterを用いて、修正されたトレーニングプロトコルでCLIP ViT-Base/16およびViT-Large/14をImageNet-1Kで微調整した。
  • 初期の学習率に対してレイヤーごとの線形スケーリング戦略を採用し、下位のレイヤーは低速で学習した。
  • 20エポックのウォームアップを伴うコサインスケジュールの学習率減衰を使用し、基本の初期学習率は1e-3とした。
  • RandAug(m9, n2, mstd0.5)、mixup(0.8)、cutmix(1.0)、およびランダムエラーズ(0.25)を含む強力なデータ拡張を適用した。
  • 正則化手法としてラベルスムージング(0.1)と重み減衰(0.05)を採用した。
  • 相対的位置エンコーディング(RPE)やレイヤースケーリング(LS)などのアーキテクチャ的変更を評価したが、性能向上は限定的であった。

実験結果

リサーチクエスチョン

  • RQ1ハイパーパrameterが洗練された場合、CLIPはImageNet-1Kで微調整において最先端の性能を達成できるか?
  • RQ2どの具体的なハイパーパrameter設定がCLIPの微調整精度を顕著に向上させるか?
  • RQ3マスクされた画像モデリングでCLIPを蒸留ターゲットとして用いる手法と比較して、直接微調整されたCLIPの性能はどの程度か?
  • RQ4アーキテクチャ的変更(例:RPE、LS)はCLIPの微調整性能を向上させるか?
  • RQ5ドロップパス、ラベルスムージング、重み減衰といった正則化手法の影響は何か?

主な発見

  • CLIP ViT-Base/16は224×224の入力解像度でImageNet-1Kで85.7%のトップ1正答率を達成し、CLIPをターゲットとするMIM手法を0.2%上回った。
  • 384×336の入力解像度では、CLIP ViT-Baseは86.6%のトップ1正答率を達成し、JFT-300MまたはJFT-3Bで事前学習されたモデルと同等の性能を示した。
  • CLIP ViT-Large/14は224×224解像度で88.0%、336×336解像度で88.3%のトップ1正答率を達成し、大規模モデルでも優れた性能を示した。
  • レイヤーごとの学習率戦略は性能向上に顕著な効果があり、半数のレイヤーを凍結した場合でも85.6%の正答率を達成した。
  • ラベルスムージング(0.1)は不可欠であった。これを除去すると過学習が生じ、トップ1正答率が85.3%に低下した。
  • ドロップパス正則化は微調整時に性能を低下させた。これは、事前学習時におけるドロップパスの欠如が原因と考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。