Skip to main content
QUICK REVIEW

[論文レビュー] Model Ratatouille: Recycling Diverse Models for Out-of-Distribution Generalization

Alexandre Ramé, Kartik Ahuja|arXiv (Cornell University)|Dec 20, 2022
Domain Adaptation and Few-Shot Learning被引用数 5
ひとこと要約

この論文では、基礎モデルの多様なファインチューニング済みモデルを再利用することで、分布外(OOD)一般化を向上させる手法「Model Ratatouille」を提案する。複数の並列的なファインチューニングを、補助的なファインチューニングからの重みで初期化し、それらを平均化することで、追加の推論コストやトレーニングコストなしに、DomainBedで最先端の性能を達成する。

ABSTRACT

Foundation models are redefining how AI systems are built. Practitioners now follow a standard procedure to build their machine learning solutions: from a pre-trained foundation model, they fine-tune the weights on the target task of interest. So, the Internet is swarmed by a handful of foundation models fine-tuned on many diverse tasks: these individual fine-tunings exist in isolation without benefiting from each other. In our opinion, this is a missed opportunity, as these specialized models contain rich and diverse features. In this paper, we thus propose model ratatouille, a new strategy to recycle the multiple fine-tunings of the same foundation model on diverse auxiliary tasks. Specifically, we repurpose these auxiliary weights as initializations for multiple parallel fine-tunings on the target task; then, we average all fine-tuned weights to obtain the final model. This recycling strategy aims at maximizing the diversity in weights by leveraging the diversity in auxiliary tasks. Empirically, it improves the state of the art on the reference DomainBed benchmark for out-of-distribution generalization. Looking forward, this work contributes to the emerging paradigm of updatable machine learning where, akin to open-source software development, the community collaborates to reliably update machine learning models. Our code is released: https://github.com/facebookresearch/ModelRatatouille.

研究の動機と目的

  • 各モデルが他のファインチューニング変種からの知識を活用しない孤立したファインチューニングの限界を解消すること。
  • 補助タスクで学習された複数のファインチューニング済みモデルの特徴の多様性を活用し、分布外(OOD)一般化の耐性を向上させること。
  • 既存のファインチューニング済みモデルを、ターゲットタスクのファインチューニングの初期化点として再利用する戦略を開発し、モデルの多様性を最大化すること。
  • 標準的なハイパーパramータ探索と比較して、追加の推論コストやトレーニングコストを負担せずに、最先端のOOD一般化性能を達成すること。
  • コミュニティの貢献を通じてモデルが共同で改善される、アップデート可能な機械学習の新しいパラダイムに貢献すること。

提案手法

  • 基礎モデルの、多様な補助タスクで事前にファインチューニングされた複数の既存モデルの重みを、ターゲットタスクの新しいファインチューニングの初期化重みとして再利用する。
  • 各補助ファインチューニング済みモデルを初期値として用い、基礎モデルをターゲットタスクで独立してファインチューニングする。
  • すべてのターゲットタスクファインチューニングの最終重みを平均化して、最終モデルを形成する。
  • 均等選択とグリーディ選択の両方の戦略を用い、補助モデルの選択が性能に与える影響を評価する。
  • 複数のファインチューニングを並列で実行できるようにすることで、計算コストを抑え、推論コストの追加なしに効率を確保する。
  • OOD一般化の評価を、DomainBed、DomainNet、Camelyonといった標準ベンチマークで実施し、多様なドメインにわたる性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1基礎モデルの多様なファインチューニング済みモデルを初期化点として再利用することで、ターゲットタスクにおける分布外一般化が向上するか?
  • RQ2補助タスクの多様性が、OOD設定における最終平均化モデルの性能にどのように影響するか?
  • RQ3Model Ratatouilleは、モデルスープやDiWAのような従来のアンサンブルおよび平均化戦略を上回るOOD一般化ベンチマーク性能を達成するか?
  • RQ4この手法は、医療画像(例:Camelyon)や細分化視覚認識(例:TerraIncognita)を含む多様なデータセットに効果的に適用可能か?
  • RQ5補助タスクがターゲットタスクと類似していない場合でも、性能向上が維持されるか、それとも補助タスクが関連している場合に最も利益をもたらすか?

主な発見

  • Model Ratatouilleは、DomainBedベンチマークで、全データセットの平均精度68.1%を達成し、モデルスープやDiWAを上回る最先端のOOD一般化性能を示した。
  • DomainNetでは、均等選択とグリーディ選択の両方で平均精度47.7%を達成し、モデルスープやDiWAと同等またはそれを上回る性能を示した。
  • Camelyonヒストパスロジー・データセットでは、モデルスープよりもOOD一般化性能が向上し、グリーディ選択で平均精度95.4%(スープは95.1%)を達成した。
  • この手法は補助タスクの選択に対して頑健である:たとえ距離の遠い補助タスク(例:TerraIncognitaにおけるDomainBed)であっても、モデルスープの51.4%からModel Ratatouilleの51.8%へと性能が向上した。
  • TerraIncognitaでより類似した補助タスク(iWildCam)を使用した場合、Model Ratatouilleは平均精度52.9%を達成し、関連する補助知識から利益を得られる能力を示した。
  • 標準的なハイパーパramータ探索と比較して、追加の推論コストやトレーニングコストを負担しないため、実世界の展開において実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。