Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Training of Visual Transformers with Small-Size Datasets

Yahui Liu, Enver Sangineto|arXiv (Cornell University)|Jun 7, 2021
Advanced Neural Network Applications参考文献 75被引用数 12
ひとこと要約

本稿では、最小限の計算コストで空間的関係の学習を促進することにより、小データ環境下での視覚変換器(VTs)の性能を向上させる自己教師ありタスクを提案する。標準的な教師あり学習と組み合わせることで、複数のアーキテクチャおよびベンチマークにおいて、VTのロバスト性と精度が顕著に向上する。

ABSTRACT

Visual Transformers (VTs) are emerging as an architectural paradigm alternative to Convolutional networks (CNNs). Differently from CNNs, VTs can capture global relations between image elements and they potentially have a larger representation capacity. However, the lack of the typical convolutional inductive bias makes these models more data-hungry than common CNNs. In fact, some local properties of the visual domain which are embedded in the CNN architectural design, in VTs should be learned from samples. In this paper, we empirically analyse different VTs, comparing their robustness in a small training-set regime, and we show that, despite having a comparable accuracy when trained on ImageNet, their performance on smaller datasets can be largely different. Moreover, we propose a self-supervised task which can extract additional information from images with only a negligible computational overhead. This task encourages the VTs to learn spatial relations within an image and makes the VT training much more robust when training data are scarce. Our task is used jointly with the standard (supervised) training and it does not depend on specific architectural choices, thus it can be easily plugged in the existing VTs. Using an extensive evaluation with different VTs and datasets, we show that our method can improve (sometimes dramatically) the final accuracy of the VTs. The code will be available upon acceptance.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNNs)に内蔵されたインダクティブバイアスが欠如しているため、データに依存する性質を持つ視覚変換器(VTs)の課題を解決すること。
  • 同じImageNet精度を達成しているにもかかわらず、VTsが小規模な学習セットで顕著な性能変動を示す理由を解明すること。
  • アーキテクチャの変更なしに、データが少ない状況下でのVTの一般化性能を向上させる自己教師あり学習部を構築すること。
  • 既存のVTアーキテクチャおよび学習パイプラインと互換性があり、即座に統合可能な方法を確保すること。

提案手法

  • グローバルなコンテキストに基づいてマスクされたパッチを予測することで、視覚変換器が画像内での空間的関係を学習するよう促す自己教師ありタスクを導入する。
  • 標準的な教師あり交差エントロピー損失と併せて、自己教師ありタスクを補助損失として訓練中に統合する。
  • 計算コストをほとんど増加させない範囲で、事前学習または微調整の段階で自己教師ありタスクを適用する。
  • 標準的なVTバックボーン(例:ViT)を用い、同じ入力データを用いて教師ありおよび自己教師ありの両方の目的を同時に学習する。
  • アーキテクチャに依存しないように自己教師ありタスクを設計し、既存のVTフレームワークへの容易な統合を可能にする。
  • 標準的な最適化プロトコルを用い、自己教師あり損失を主分類目的とバランスさせるように重み付けする。

実験結果

リサーチクエスチョン

  • RQ1同じImageNet精度を達成しているにもかかわらず、異なる視覚変換器アーキテクチャが小データセットでどのように性能を発揮するか。
  • RQ2軽量な自己教師ありタスクが、低データ環境下での視覚変換器のロバスト性を向上させられるか。
  • RQ3計算コストを増加させることなく、提案された自己教師ありタスクがVTの空間的理解を向上させられるか。
  • RQ4この手法が、異なるVTアーキテクチャおよびデータセットにわたってどの程度一般化可能か。

主な発見

  • 視覚変換器は、ImageNetで同等の精度を達成しているにもかかわらず、小規模データセットでは顕著な性能差を示す。
  • 提案された自己教師ありタスクは、複数のアーキテクチャにわたり、小規模データセットにおけるVTの精度を向上させる。
  • CIFAR-100 や Stanford Cars のようなベンチマークにおいて、限られた学習データ下で顕著な精度向上が得られ、場合によっては劇的である。
  • 自己教師あり部は計算コストをほとんど増加させず、実世界の展開において実用的である。
  • この手法は、基盤となるVTアーキテクチャに依存せず、広範な互換性と即時統合性を示している。
  • 自己教師ありタスクと併用した共同学習により、特にデータが少ない状況下で、より優れた特徴学習と一般化性能が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。