Skip to main content
QUICK REVIEW

[論文レビュー] What Happens During Finetuning of Vision Transformers: An Invariance Based Investigation

Gabriele Merlin, Vedant Nanda|arXiv (Cornell University)|Jul 12, 2023
Advanced Neural Network ApplicationsComputer Science被引用数 3
ひとこと要約

本稿は、ビジョントランスフォーマー(ViTs)のファインチューニング中に、事前学習段階で学習された不変性がどのように保持されたり変化したりするかを調査する。STIRに基づく新しい不変性指標を用いることで、事前学習段階で浅い層に移行可能な不変性が誘導され、ファインチューニング段階で深い層の不変性が浅い層に向かって圧縮されることが明らかになった。これは、なぜ事前学習が下流性能を向上させるのか、およびモデル表現が適応過程でどのように進化するのかを理解する手がかりを提供する。

ABSTRACT

The pretrain-finetune paradigm usually improves downstream performance over training a model from scratch on the same task, becoming commonplace across many areas of machine learning. While pretraining is empirically observed to be beneficial for a range of tasks, there is not a clear understanding yet of the reasons for this effect. In this work, we examine the relationship between pretrained vision transformers and the corresponding finetuned versions on several benchmark datasets and tasks. We present new metrics that specifically investigate the degree to which invariances learned by a pretrained model are retained or forgotten during finetuning. Using these metrics, we present a suite of empirical findings, including that pretraining induces transferable invariances in shallow layers and that invariances from deeper pretrained layers are compressed towards shallower layers during finetuning. Together, these findings contribute to understanding some of the reasons for the successes of pretrained models and the changes that a pretrained model undergoes when finetuned on a downstream task.

研究の動機と目的

  • ビジョントランスフォーマーにおける事前学習が下流性能を向上させる理由を、特にトランスファーラーニング設定において理解すること。
  • 事前学習段階で学習された不変性が、下流タスクにおけるファインチューニング段階でどのように変更されたり、保持されたり、あるいは忘れられるかを調査すること。
  • ファインチューニング段階における安定性(古い不変性の保持)と可塑性(新しい不変性の学習)の間の動的なトレードオフを特徴づけること。
  • 従来の表現類似性や精度に基づく分析を超えて、ファインチューニング中の層間における不変性の移行と変化を定量化するための新しい指標を開発すること。
  • 層ごとの不変性の進化を分析することで、事前学習・ファインチューニングのパラダイムの成功のメカニズムを解明すること。

提案手法

  • 特定のデータの摂動に対して、事前学習済みモデルとそのファインチューニング版との間で共有される不変性を測定するため、STIR(Similarity of Transferable Invariances)を採用する。
  • ファインチューニング段階における不変性の忘却(事前学習で得た不変性の喪失)と不変性の学習(新しい不変性の習得)を定量化する新しい指標を定義する。
  • 複数のベンチマークデータセット(例:CIFAR-10、ImageNet)とタスクを用いて、層ごとの不変性ダイナミクスを分析する。
  • 初期学習ダイナミクス(例:各層における平均精度と忘却の標準偏差)と最終的な破損データに対する耐障害性との相関分析を実施し、モデル安定性の早期指標を評価する。
  • ハイパーパrameter(学習率、最適化手法、データオーグメンテーション)を系統的に変更することで、観察された不変性パターンの頑健性を検証する。
  • アブレーションスタディを実施し、初期学習エポックが不変性の安定性と耐障害性に与える寄与を分離する。

実験結果

リサーチクエスチョン

  • RQ1事前学習段階で学習された不変性は、ViTのファインチューニング段階でどの程度保持されたり、忘れられたりするか?
  • RQ2事前学習済みViTの深い層からの不変性は、ファインチューニング段階でどのように変化するか?また、浅い層への圧縮の兆候は見られるか?
  • RQ3不変性ダイナミクス(忘却と学習)とファインチューニング中のモデルの耐障害性の関係は何か?
  • RQ4初期学習ダイナミクス、特に各層における忘却の標準偏差は、最終的なモデル耐障害性を信頼できる指標として機能するか?
  • RQ5異なる最適化手法(例:SGD と Adam)は、不変性ダイナミクスと破損データ上でのモデル性能の関係にどのように影響するか?

主な発見

  • 事前学習により、特にビジョントランスフォーマーの浅い層に移行可能な不変性が誘導され、これが下流性能に不可欠である。
  • ファインチューニング段階で、事前学習済みモデルの深い層からの不変性が浅い層に向かって圧縮されることが示された。これは、表現能力を再配分するメカニズムを示唆している。
  • 初期学習段階における各層の忘却の標準偏差は、破損データセットに対する最終的なモデル耐障害性と強く相関しており、最初の20エポックのみを考慮しても同様に成立する。
  • この相関関係は初期学習段階で強いかつ、あるいはさらに強くなる傾向があるため、初期の不変性ダイナミクスが耐障害性を予測可能であり、後続の最適化行動の結果ではなく、予測的要因であることが示された。
  • SGDを用いた設定では、不変性ダイナミクスと耐障害性の関係は異なるハイパーパrameter設定に対しても成立するが、Adamを用いた場合には一貫して成立せず、不変性安定性が最適化手法に依存する傾向があることが示唆された。
  • 本研究の結果から、不変性の圧縮と層特有の忘却ダイナミクスが、ViTにおける事前学習・ファインチューニングパラダイムの成功の背後にある主要なメカニズムであると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。