[論文レビュー] No Reason for No Supervision: Improved Generalization in Supervised Models
本論文は、マルチスケールのデータオーグメンテーションと一時的プロジェクターヘッド、およびオンラインクラスプロトタイプ計算を組み合わせることで、深層ニューラルネットワークにおける一般化性能を向上させる教師あり学習の設定を提案する。この手法により、t-ReX および t-ReX* が作成され、ImageNet-1K の分類(トップ1精度80.2%)および転移学習(13のタスクにおける平均転移精度76.2%)の両方で最先端性能を達成し、先行する教師あり、自己教師あり、半教師ありモデルを上回った。
We consider the problem of training a deep neural network on a given classification task, e.g., ImageNet-1K (IN1K), so that it excels at both the training task as well as at other (future) transfer tasks. These two seemingly contradictory properties impose a trade-off between improving the model's generalization and maintaining its performance on the original task. Models trained with self-supervised learning tend to generalize better than their supervised counterparts for transfer learning; yet, they still lag behind supervised models on IN1K. In this paper, we propose a supervised learning setup that leverages the best of both worlds. We extensively analyze supervised training using multi-scale crops for data augmentation and an expendable projector head, and reveal that the design of the projector allows us to control the trade-off between performance on the training task and transferability. We further replace the last layer of class weights with class prototypes computed on the fly using a memory bank and derive two models: t-ReX that achieves a new state of the art for transfer learning and outperforms top methods such as DINO and PAWS on IN1K, and t-ReX* that matches the highly optimized RSB-A1 model on IN1K while performing better on transfer tasks. Code and pretrained models: https://europe.naverlabs.com/t-rex
研究の動機と目的
- 元の教師ありタスクにおける高い性能と、下流の転移タスクへの強力な一般化性能の間のトレードオフを解消すること。
- ImageNet-1K で優れた性能を示すにもかかわらず、転移学習では自己教師ありモデルに劣ることが多い理由を解明すること。
- 自己教師あり学習から得られる要因(特にマルチクロップオーグメンテーションと一時的プロジェクターヘッド)を同定し、それらを活用することで、元のタスクの精度を損なわずに転移性を向上させること。
- メモリ効率の良いオンラインクラスプロトタイプ計算手法を開発し、表現品質を向上させること。
提案手法
- 一般化性能を向上させるために、マルチスケールのクロップを用いたデータオーグメンテーションを導入した教師あり学習設定を提案する。
- エンコーダーの直後に一時的プロジェクターヘッドを設け、推論時には破棄することで、分離された特徴量と転移可能な特徴量を促進する。
- 最終分類器レイヤーを、メモリキューを用いたオンラインクラスプロトタイプ計算に置き換え、トレーニング中に動的かつメモリ効率の良いプロトタイプの更新を可能にする。
- 転移性能を評価するために、元の ImageNet-1K トレーニングセット上で線形分類器ヘッドを訓練する。
- 交差エントロピー損失を用いた標準的な教師あり学習を実施するが、最終レイヤーを固定クラス重みの代わりにプロトタイプを用いるように変更する。
- マルチクロップオーグメンテーション、プロジェクターヘッド設計、プロトタイプ計算の各要因が IN1K 精度および転移性能に与える影響を広範なアブレーションスタディで評価する。
実験結果
リサーチクエスチョン
- RQ1マルチスケールクロップオーグメンテーションは、教師ありモデルにおけるドメイン内精度と転移性のトレードオフにどのように影響するか?
- RQ2一時的プロジェクターヘッドの設計は、教師ありモデルの一般化能力にどの程度影響を与えるか?
- RQ3オンラインクラスプロトタイプ計算は、ドメイン内精度を損なわずに転移性能を向上させることができるか?
- RQ4ImageNet-1K 精度を向上させる一部の正則化技術がなぜ転移性を低下させるのか、その理由と緩和法は何か?
- RQ5教師あり学習設定が、ImageNet-1K および転移学習ベンチマークの両方で最先端性能を同時に達成できるか?
主な発見
- t-ReX は13の下流タスクにおける平均転移精度76.2%を達成し、DINO(69.9%)および PAWS(71.6%)を上回り、新たな最先端性能を樹立した。
- t-ReX* は ImageNet-1K でトップ1精度80.2%を達成し、RSB-A1 モデル(79.8%)を上回り、このベンチマークにおける教師ありモデルの新たな最先端性能を樹立した。
- オンラインクラスプロトタイプとマルチクロップオーグメンテーションを用いたモデルは、ベースラインモデルと比較して、DTD データセットで最大0.15の特徴冗長性が低減しており、より効率的な表現であることが示された。
- 一時的プロジェクターヘッドの導入により、IN1K 精度と転移性の性能トレードオフを制御可能となり、アブレーション結果から、ドメイン内性能を損なわずに一般化性能が向上することが確認された。
- t-ReX および t-ReX* は、iNaturalist 2018 および 2019 の長尾データセットに対しても強力な性能を維持しており、t-ReX はそれぞれトップ1精度45.8%および54.2%を達成し、RSB-A1 や DINO を上回った。
- 可視化結果から、t-ReX* のプロトタイプはより意味的に整合性が高く、クエリクラス(例:「ゴールディッシュ」や「熱帯魚」)の最近傍のクラスが意味的に関連していることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。