Skip to main content
QUICK REVIEW

[論文レビュー] ResMLP: Feedforward networks for image classification with data-efficient training

Hugo Touvron, Piotr Bojanowski|arXiv (Cornell University)|May 7, 2021
Digital Imaging for Blood Diseases被引用数 5
ひとこと要約

ResMLP は、自己注意機構の代わりに線形なパッチ相互作用を用いる、画像分類のための単純な完全に前向き伝搬型のニューラルネットワークアーキテクチャであり、データ効率的な学習を用いて ImageNet-1k で最先端の精度を達成した。このモデルは、線形層と GELU 活性化関数のみを用いて ViT の性能を同等または上回り、現代の学習戦略により、畳み込みや注意機構のようなアーキテクチャの事前知識がなくても MLP 僅どのモデルが非常に有効であることを示している。

ABSTRACT

We present ResMLP, an architecture built entirely upon multi-layer perceptrons for image classification. It is a simple residual network that alternates (i) a linear layer in which image patches interact, independently and identically across channels, and (ii) a two-layer feed-forward network in which channels interact independently per patch. When trained with a modern training strategy using heavy data-augmentation and optionally distillation, it attains surprisingly good accuracy/complexity trade-offs on ImageNet. We also train ResMLP models in a self-supervised setup, to further remove priors from employing a labelled dataset. Finally, by adapting our model to machine translation we achieve surprisingly good results. We share pre-trained models and our code based on the Timm library.

研究の動機と目的

  • 畳み込みや自己注意機構のようなインダクティブバイアスを一切持たない、完全に多層パーセプトロン(MLP)アーキテクチャが、画像分類で優れた性能を達成できるかどうかを検討すること。
  • 重いデータオーグメンテーションや知識蒸留といったデータ効率的な学習戦略が、単純な MLP がビジョントランスフォーマーの性能を同等または上回ることを可能にするかどうかを調査すること。
  • このようなモデルが、機械翻訳のような系列から系列へのタスクを含む、画像以外の分野にも一般化できるかどうかを評価すること。
  • モデルの内部表現を分析し、最小限のアーキテクチャから訓練によってどのようなインダクティブバイアスが出現するかを理解すること。

提案手法

  • ResMLP は、重複のない画像パッチを線形投影により d 次元の埋め込みに変換する。
  • ネットワークは、(1) 共通の重みを用いてパッチ間の相互作用を許容するクロスパッチ線形層、および (2) パッチごとにチャンネル単位で相互作用を可能にする二層のフィードフォワードネットワークからなる二つの残差ブロックを交互に適用する。
  • 各ブロックは残差接続と事前正規化を用いるが、バッチ正規化やレイヤー正規化は導入しない。
  • 最終的なパッチ表現は平均化され、画像レベルの予測のための線形分類器に渡される。
  • モデルはクロスエントロピー損失を用いて学習され、データオーグメンテーションと、必要に応じて教師モデルからの知識蒸留が併用される。
  • 機械翻訳向けに、ResMLP ブロックをトランスフォーマー層に置き換えた、系列から系列への変種が開発され、エンコーダーとデコーダー間のクロスアテンションを維持している。

実験結果

リサーチクエスチョン

  • RQ1自己注意機構や畳み込みのインダクティブバイアスを一切持たない、完全に前向き伝搬型のネットワークが、データ効率的な学習を用いて ImageNet-1k で競争力のある性能を達成できるか?
  • RQ2同じ現代的な学習レジームで訓練された場合、最小限の MLP アーキテクチャの性能はビジョントランスフォーマーと比べてどの程度か?
  • RQ3自己教師付き事前学習や知識蒸留は、単純な MLP ベースのモデルの精度をどの程度向上できるか?
  • RQ4ResMLP を用いたアーキテクチャは、画像認識以外の分野、特に機械翻訳のような系列から系列へのタスクに一般化できるか?
  • RQ5最小限の MLP アーキテクチャを学習させた際に、学習されたフィルタにどのようなインダクティブバイアスが出現するか、またそれらは畳み込みや注意機構と比べてどうか?

主な発見

  • ResMLP は、線形層とフィードフォワードネットワークのみで構成される単純なアーキテクチャでありながら、同じ学習レジーム下で ImageNet-1k で最先端の精度を達成し、ViT を上回るか同等の性能を示した。
  • 同じデータオーグメンテーションおよび蒸留戦略を用いた場合、ビジョントランスフォーマーと比較してより安定して学習が進行し、バッチ正規化やレイヤー正規化を省略できることがわかった。
  • 線形層の可視化から、初期層では畳み込みに類似したフィルタパターンが観察され、深層部では長距離相互作用が現れるなど、空間的なインダクティブバイアスが自然に出現していることが示唆された。
  • 知識蒸留は ResMLP に著しく利益をもたらし、ラベル付きデータが限られた状況でも高い精度を達成できた。
  • DINO などの自己教師付き事前学習手法とも互換性があり、ラベルなしデータでの強力な性能を発揮できることが確認された。
  • 系列から系列へのタスク向けに開発された ResMLP の変種は、WMT 機械翻訳ベンチマークで競争力ある結果を達成し、コンピュータビジョンを超えた汎用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。