Skip to main content
QUICK REVIEW

[論文レビュー] ImageNet-21K Pretraining for the Masses

Tal Ridnik, Emanuel Ben-Baruch|arXiv (Cornell University)|Apr 22, 2021
Multimodal Machine Learning Applications参考文献 57被引用数 4
ひとこと要約

本論文は、単一ラベルのアノテーションを語義的マルチラベルに変換するためにワードネットの階層的構造を活用し、ImageNet-21Kのための新規で効率的かつアクセス可能な事前学習パイプラインを提示する。語義的ソフトマックスと呼ばれる新しい訓練スキームを導入することで、小型モバイルアーキテクチャを含む多様なモデルにおいて、ImageNet-1Kおよび先行するImageNet-21K事前学習手法を著しく上回り、公開データのみを用いてImageNet-1Kおよび複数の下流タスクで最先端の結果を達成する。

ABSTRACT

ImageNet-1K serves as the primary dataset for pretraining deep learning models for computer vision tasks. ImageNet-21K dataset, which is bigger and more diverse, is used less frequently for pretraining, mainly due to its complexity, low accessibility, and underestimation of its added value. This paper aims to close this gap, and make high-quality efficient pretraining on ImageNet-21K available for everyone. Via a dedicated preprocessing stage, utilization of WordNet hierarchical structure, and a novel training scheme called semantic softmax, we show that various models significantly benefit from ImageNet-21K pretraining on numerous datasets and tasks, including small mobile-oriented models. We also show that we outperform previous ImageNet-21K pretraining schemes for prominent new models like ViT and Mixer. Our proposed pretraining pipeline is efficient, accessible, and leads to SoTA reproducible results, from a publicly available dataset. The training code and pretrained models are available at: https://github.com/Alibaba-MIIL/ImageNet21K

研究の動機と目的

  • ImageNet-1Kに比べてスケールと多様性に優れるにもかかわらず、ImageNet-21Kが十分に活用されていない問題に対処すること。
  • 非排他的ラベル、標準化された分割の欠如、高い計算コストといった、ImageNet-21Kにおける事前学習の課題を克服すること。
  • 方法論的に妥当で、効率的かつ再現可能であり、すべての研究者に高品質なImageNet-21K事前学習を可能にするパイプラインを開発すること。
  • 小型でモバイル最適化されたモデルですらImageNet-21K事前学習から顕著な利益を得られることを示し、大規模な事前学習は大規模アーキテクチャに限定されるという仮説に挑戦すること。

提案手法

  • 画像解像度の標準化、学習・検証用の分割作成、クラスレベルでの画像バランスの確保を通じてImageNet-21Kを前処理する。
  • ワードネットのシンセット階層を用いて、各単一ラベルを階層的関係を表す語義的マルチラベルの集合に変換する。
  • ワードネット階層の複数のレベルに別々のソフトマックスを適用し、階層のバランスを考慮して損失を統合する「語義的ソフトマックス」と呼ばれる新しい訓練スキームを設計する。
  • 特徴表現と下流タスクのパフォーマンスをさらに向上させるために、語義的ソフトマックスを専用の知識蒸留損失に統合する。
  • ViT、ResNet、MobileNetV3、OFA-595を含む多様なモデルを対象とし、多様な下流タスクにおいてパイプラインを適用する。
  • 公開GitHubリポジトリを通じてトレーニングコードと事前学習済みモデルをリリースすることで、再現性を確保する。

実験結果

リサーチクエスチョン

  • RQ1スケールと品質に優れるにもかかわらず、歴史的に活用が不十分であったImageNet-21Kに対して、標準的で効率的かつアクセス可能な事前学習パイプラインを構築できるか?
  • RQ2語義的階層を活用したマルチラベル学習により、単一ラベル学習に比べて下流タスクのパフォーマンスが向上するか?
  • RQ3提案された語義的ソフトマックス手法は、ImageNet-21Kラベルの階層的構造を効果的に活用し、単一ラベルおよびマルチラベル学習を上回る性能を達成できるか?
  • RQ4小型でモバイル最適化されたモデルはImageNet-21K事前学習から利益を得られるか?これは、大規模なデータセットの利点は大規模アーキテクチャに限定されるという考えに挑戦する。
  • RQ5プライベートデータに依存せずに、ImageNet-1Kで最先端のパフォーマンスを達成できるか?

主な発見

  • 提案された語義的ソフトマックス事前学習スキームは、MobileNetV3やOFA-595を含むすべてのテストモデルにおいて、標準的なImageNet-1K事前学習を著しく上回り、iNaturalistでは2.9%の絶対的向上を達成する。
  • 語義的ソフトマックスを用いたImageNet-21K事前学習は、公開データのみを用いて、MobileNetV3を用いてImageNet-1Kで78.0%のトップ1精度という新記録を樹立し、元の報告値75.2%を上回る。
  • ResNet50では、ImageNet-1Kでトップ1精度82.0%を達成し、先行研究で報告された76.0%から6.0%の向上を示す。
  • 語義的ソフトマックスアプローチは、インダクティブバイアスに欠けるため通常微調整が難しいMLPベースのモデル(ViTやMixer)においても、訓練の安定性とパフォーマンスを向上させる。
  • 小型モデルですらImageNet-21K事前学習から利益を得られることを示し、大規模な事前学習が大規模アーキテクチャに限定されないことを裏付ける。
  • プライベートデータを一切使用せず、公開データとコードのみを用いて、アクション認識やPascal-VOCなどの複数の下流タスクでSOTA結果を達成する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。