Skip to main content
QUICK REVIEW

[論文レビュー] Deep Ensembles for Low-Data Transfer Learning

Basil Mustafa, Carlos Riquelme Ruiz|arXiv (Cornell University)|Oct 14, 2020
Domain Adaptation and Few-Shot Learning参考文献 48被引用数 9
ひとこと要約

本論文では、低データ転移学習において、事前学習の多様性をモデル多様性の源泉として活用することで、事前学習済みモデルから実用的な深層アンサンブルを構築する手法を提案する。k-NN正答率を用いて上位モデルをランク付けし、交差エントロピー最小化に基づく貪欲なアンサンブル構築により、19のVTABタスクで最先端の性能を達成した。推論コストは著しく低減されており、FLOPSの6分の1未満で、むしろ大規模な最先端モデルをも凌駆する結果となった。

ABSTRACT

In the low-data regime, it is difficult to train good supervised models from scratch. Instead practitioners turn to pre-trained models, leveraging transfer learning. Ensembling is an empirically and theoretically appealing way to construct powerful predictive models, but the predominant approach of training multiple deep networks with different random initialisations collides with the need for transfer via pre-trained weights. In this work, we study different ways of creating ensembles from pre-trained models. We show that the nature of pre-training itself is a performant source of diversity, and propose a practical algorithm that efficiently identifies a subset of pre-trained models for any downstream dataset. The approach is simple: Use nearest-neighbour accuracy to rank pre-trained models, fine-tune the best ones with a small hyperparameter sweep, and greedily construct an ensemble to minimise validation cross-entropy. When evaluated together with strong baselines on 19 different downstream tasks (the Visual Task Adaptation Benchmark), this achieves state-of-the-art performance at a much lower inference budget, even when selecting from over 2,000 pre-trained models. We also assess our ensembles on ImageNet variants and show improved robustness to distribution shift.

研究の動機と目的

  • 学習から再び開始することができない低データ転移学習の状況で、高い性能を達成することに挑戦する。
  • 初期化のランダム化やデータシャッフルに依存する標準的なアンサンブル手法の限界を克服する。これらは事前学習済みモデルを用いる際には現実的ではない。
  • 異なる事前学習手法やアーキテクチャからの固有の多様性を、アンサンブルの多様性の主な源泉として活用する。
  • 大規模なプール(例:2,000モデル)から、微調整およびアンサンブルに適した少数の高パフォーマンスモデルを効率的かつスケーラブルに選択するためのパイプラインを開発する。
  • 推論コストを最小限に抑えつつ、分布シフトに対する耐性と精度を最大化する。

提案手法

  • 特定の下流タスクに適した事前学習モデルの適性を推定するための低コストなプロキシ指標として、検証セット上でleave-one-out k-NN正答率を用いる。
  • k-NN正答率に基づいて上位k個の事前学習モデルを選別し、アンサンブル構築のための初期候補プールを形成する。
  • 微調整のための小さなハイパーパramータース윕(例:初期化子、データオーグメンテーション、ランダムシードの変更)を用いて、多様なエキスパートを生成する。
  • 検証交差エントロピー損失を最も小さくするモデルを反復的に追加することで、最終的なアンサンブルを貪欲に構築する。
  • 過学習を抑えるために、正答率ではなく交差エントロピーに基づいてアンサンブル選択を最適化する。これは、小さな検証セットでの過学習を低減する。
  • 複数の下流タスクおよび分布シフトを加えたImageNetバージョンを用いて、アンサンブルの性能を評価し、耐性と一般化性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1事前学習の多様性のみで、低データ転移学習における効果的な深層アンサンブルのための十分なモデル多様性を提供できるか?
  • RQ2大規模な事前学習モデルプールにおいて、下流の微調整性能を予測するプロキシ指標としてk-NN正答率はどの程度有効か?
  • RQ3上流の事前学習の多様性に基づいて選択されたモデルのアンサンブルは、下流のハイパーパramーターやデータオーグメンテーションによる多様性に基づくアンサンブルを上回るか?
  • RQ4交差エントロピー最小化に基づく貪欲なアンサンブル選択戦略は、正答率ベースの選択と比較して、小さな検証セットでの過学習をどの程度低減できるか?
  • RQ5このようなアンサンブルは、単一モデルや標準的なアンサンブルと比較して、分布シフトに対する耐性をどの程度向上させるか?

主な発見

  • 提案手法は、視覚的タスク適応ベンチマーク(VTAB)で最先端の性能を達成し、SOTAを1.8%の絶対的正答率向上で上回った。
  • 上流の事前学習の多様性に基づくアンサンブルは、下流の多様性に基づくアンサンブルよりも、19のVTABタスク平均で1.2ポイント高い性能を示した。
  • 本手法は分布シフトに対する耐性を向上させ、分布がシフトしたImageNetバージョンにおいて、ベースラインアンサンブルと比較して平均2.2%の正答率向上を達成した。
  • 最終的なアンサンブルはVTABで77.6%の正答率を達成し、はるかに大きなSOTAモデル(76.2%)と同等の性能を発揮したが、FLOPSは6分の1未満で、優れた効率性を示した。
  • 交差エントロピー最小化に基づく貪欲なアンサンブル選択は、正答率ベースの選択よりも一般化性能が高く、アンサンブルサイズが増加するにつれてテスト性能が単調に向上した。
  • 広範なアブレーションの結果、ブートストラップやリプレースメント戦略は過学習を低減できず、重み付きアンサンブルも性能向上をもたらさなかった。これは、交差エントロピー選択アプローチの頑健性を強く示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。