Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Supervised Pre-training for Better Downstream Transferring

Yutong Feng, Jianwen Jiang|arXiv (Cornell University)|Oct 12, 2021
Domain Adaptation and Few-Shot Learning参考文献 47被引用数 9
ひとこと要約

この論文は、クラス内意味的多様性を保持することで、下流の転移性を向上させる、新しい教師あり事前学習手法LOOK(Leave-One-Out K-Nearest-Neighbor)を提案する。同じクラスのすべての画像を単一のクラスタに押し込むのではなく、LOOKは各画像がそのk番目の近隣の多くと同一クラスラベルを共有することを要件とするkNNベースの損失関数を用いる。これにより、マルチモーダルなクラス分布が可能となり、視覚的変異のより良い表現が可能になり、画像分類、検出、セグメンテーションを含む複数の下流タスクで最先端の性能を達成する。

ABSTRACT

The pretrain-finetune paradigm has shown outstanding performance on many applications of deep learning, where a model is pre-trained on a upstream large dataset (e.g. ImageNet), and is then fine-tuned to different downstream tasks. Though for most cases, the pre-training stage is conducted based on supervised methods, recent works on self-supervised pre-training have shown powerful transferability and even outperform supervised pre-training on multiple downstream tasks. It thus remains an open question how to better generalize supervised pre-training model to downstream tasks. In this paper, we argue that the worse transferability of existing supervised pre-training methods arise from the negligence of valuable intra-class semantic difference. This is because these methods tend to push images from the same class close to each other despite of the large diversity in their visual contents, a problem to which referred as "overfit of upstream tasks". To alleviate this problem, we propose a new supervised pre-training method based on Leave-One-Out K-Nearest-Neighbor, or LOOK for short. It relieves the problem of overfitting upstream tasks by only requiring each image to share its class label with most of its k nearest neighbors, thus allowing each class to exhibit a multi-mode distribution and consequentially preserving part of intra-class difference for better transferring to downstream tasks. We developed efficient implementation of the proposed method that scales well to large datasets. Experimental studies on multiple downstream tasks show that LOOK outperforms other state-of-the-art methods for supervised and self-supervised pre-training.

研究の動機と目的

  • 既存の教師あり事前学習手法が、クラス内変動を単一のクラスタに収縮させることで上流タスクに過適合するという問題を解決する。
  • 特に細分化されたまたは多様な視覚的カテゴリに対して、クラス内における意味的差異を保持することで、下流の性能を向上させる。
  • 大規模データセットで高い性能を維持しつつ、スケーラブルで効率的なkNNベースの損失の実装を開発する。
  • k番目の近隣の大多数との合意を要件とする緩い分類制約が、厳密な交差エントロピーまたは対照的学習よりも優れた一般化をもたらすかを示す。

提案手法

  • 深層ニューラルネットワークの最終分類ヘッドを、柔軟で局所的な決定境界を許容する重み付きkNN分類器に置き換える。
  • 各サンプルがそのk番目の近隣の大多数のクラスと一致するかを評価する、leave-one-out kNN分類誤差を損失関数として使用する。
  • この損失関数を用いてモデルをエンドツーエンドで訓練し、特徴空間にクラス内多様性を保持するよう促進する。これにより、マルチモーダルな分布が可能になる。
  • 検出およびセグメンテーションタスクでの性能向上を目的として、LOOKの改善版である2つのアーギュメント付きビューを導入する。
  • ImageNetやCOCOなどの大規模データセットにスケーリング可能な、微分可能なkNN近似を実装する。
  • 訓練中に温度の段階的低下を適用し、正例の選択を安定化させ、最適化の安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1教師あり事前学習における分類制約を緩めることで、クラス内意味的多様性を保持できれば、下流の転移性が向上するのか?
  • RQ2kNNベースの損失関数が、k番目の近隣の大多数との合意のみを要件とする場合、標準的な交差エントロピーまたは対照的学習よりも優れた特徴表現が得られるのか?
  • RQ3提案手法LOOKは、多様な下流タスクにおいて、最先端の教師ありおよび自己教師あり事前学習手法と比較してどのように評価されるか?
  • RQ4kNNベースのアプローチは、視覚的背景や誤った相関関係に過剰適合することを避けつつ、高レベルの意味的特徴をどれだけ保持できるか?

主な発見

  • ImageNetの線形プローブタスクにおいて、LOOKは標準的な交差エントロピーおよび教師あり対照的学習を上回り、複数のバックボーンアーキテクチャで高いトップ-1精度を達成する。
  • COCOオブジェクト検出およびインスタンスセグメンテーションベンチマークにおいて、LOOKの2アーギュメント付きビュー版は、MoCo-v2 や BYOL などの自己教師あり手法と比較して、同等または優れた性能を示す。
  • アテンションマップの可視化結果から、LOOKはSupConが関連しないが意味的に重要な要素を無視するのに対し、コアオブジェクトを超えたより多くの意味的詳細に注目している。
  • MoCo-v2のアテンションマップは画像全体に均等に分布しているが、LOOKはグローバルおよびローカルな意味的特徴を両方とも保持するバランスの取れた性能を示している。
  • kNNフィルタリングによる安定した正例選択のおかげで、ハイパーパrameter、特に温度の段階的低下に対して、本手法は頑健である。
  • 実験的結果から、kNNベースの監視によりクラス内変動を保持することで、特に細分化分類や複雑なシーン理解タスクにおいて、より優れた一般化が達成されることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。