Skip to main content
QUICK REVIEW

[論文レビュー] Solving ImageNet: a Unified Scheme for Training any Backbone to Top Results

Tal Ridnik, Hussam Lawen|arXiv (Cornell University)|Apr 7, 2022
Advanced Neural Network Applications被引用数 5
ひとこと要約

本稿では、任意のバックボーンアーキテクチャ(畳み込みニューラルネットワーク(CNN)、トランスフォーマー、モバイル向け、MLPオンリーのモデルを含む)が、ハイパーパrameterチューニングを一切行わずに、SOTAのImageNet top-1精度を達成できる、プラグアンドプレイなトレーニングフレームワークであるUSI(Unified Scheme for ImageNet)を紹介する。強力な教師モデルを用いた知識蒸留と最小限の補助的手法を活用することで、多様なアーキテクチャにわたり一貫した性能向上を実現し、ImageNetトレーニングを自動的かつアーキテクチャに依存しないプロセスへと変革する。

ABSTRACT

ImageNet serves as the primary dataset for evaluating the quality of computer-vision models. The common practice today is training each architecture with a tailor-made scheme, designed and tuned by an expert. In this paper, we present a unified scheme for training any backbone on ImageNet. The scheme, named USI (Unified Scheme for ImageNet), is based on knowledge distillation and modern tricks. It requires no adjustments or hyper-parameters tuning between different models, and is efficient in terms of training times. We test USI on a wide variety of architectures, including CNNs, Transformers, Mobile-oriented and MLP-only. On all models tested, USI outperforms previous state-of-the-art results. Hence, we are able to transform training on ImageNet from an expert-oriented task to an automatic seamless routine. Since USI accepts any backbone and trains it to top results, it also enables to perform methodical comparisons, and identify the most efficient backbones along the speed-accuracy Pareto curve. Implementation is available at:https://github.com/Alibaba-MIIL/Solving_ImageNet

研究の動機と目的

  • ImageNet用に、アーキテクチャ固有の専門家によるチューニングが不要な、普遍的なトレーニングフレームワークを導入すること。
  • CNN、トランスフォーマー、モバイルモデル、MLPオンリーのネットワークを含む、多様なバックボーンアーキテクチャにわたって、一貫した高精度なトレーニングを可能にすること。
  • 共通で信頼性のあるトレーニングベースラインを提供することで、速度-精度パレートフロンティアに沿ったモデルの体系的比較を確立すること。
  • 知識蒸留を適切に適用することで、膨大な正則化やハイパーパrameterチューニングが不要な状態でも、強固で高精度なトレーニングのコアメカニズムとして機能することを示すこと。

提案手法

  • 教師モデル(強力なモデル)を用いて知識蒸留(KD)を実行し、トレーニング中に学生(ターゲット)ネットワークをガイドする。教師と学生のログティチュードの間でKLダイバージェンス損失を用いる。
  • KDの相対的重み(α_kd = 5)を固定し、温度スケーリング(τ = 1)を用いない。これらの設定が、あらゆるモデルで最適な性能を発揮することが判明した。
  • 主な正則化としてMixup-Cutmixデータオーグメンテーションを採用。これはCutoutや無しのオーグメンテーションよりも優れた性能を示す。
  • 普遍性を維持するため、アーキテクチャ固有の正則化(例:ドロップパス、ドロップブロック)を避ける。これらの手法は、統一された枠組みでは恩恵をもたらさない。
  • モデル固有の調整なしに、標準的で強力なトレーニングレシピ(例:1000エポック、大規模バッチサイズ、学習率スケーリング)を用いてトレーニングする。
  • 再実装を公開リポジトリ(timm)に実施し、再現可能性の検証と広範なアクセス可能性を確保する。

実験結果

リサーチクエスチョン

  • RQ1アーキテクチャ固有のチューニングなしに、同一の統一されたトレーニングスキームが、多様なバックボーンアーキテクチャでImageNet上でSOTAの性能を達成できるか?
  • RQ2追加の正則化がなく、知識蒸留のみを用いる場合、どの程度のトレーニングの安定性と精度の向上が、さまざまなモデルファミリーにわたって達成できるか?
  • RQ3KD損失の重みや温度といったハイパーパrameterが、統一された設定下で性能に及ぼす影響はどの程度か?
  • RQ4アーキテクチャ固有の正則化(例:ドロップパス)を含めることで、普遍的なスキームでの結果が向上するのか、それとも余分な手法にとどまるのか?
  • RQ5統一されたスキームが、速度-精度パレート曲線に沿った、信頼性の高い体系的モデル比較を可能にするか?

主な発見

  • USIは、ResNet系、モバイル指向、トランスフォーマー基盤、MLPオンリーのモデルを含む、すべてのテスト対象アーキテクチャで、ハイパーパrameterチューニングなしにImageNet-1KでSOTAのtop-1精度を達成した。
  • LeViT-384では、USIで82.7%のtop-1精度を達成した。交差エントロピー損失を削除し、KDのみに依存する(α_kd = ∞)場合でも、この精度は変化しなかった。
  • 最適なKD相対的重みはα_kd = 5である。これより低い値(例:α_kd = 1)やKDなし(α_kd = 0)では、顕著な性能低下(例:76.2%の精度)が観察された。
  • KDの温度スケーリング(τ)は有害である。τ < 1およびτ > 1の両方とも精度を低下させ、τ = 1(通常の確率)が最良の結果をもたらした。
  • Mixup-Cutmixオーグメンテーションは、LeViT-384で82.7%のtop-1精度を達成し、Cutout(82.4%)や無し(82.0%)のオーグメンテーションよりも優れた性能を示した。
  • ドロップパス正則化はUSIスキームで効果を示さず、精度はわずかに低下(82.5%)した。これは、アーキテクチャ固有の正則化が統一された設定では不要であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。