Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Learning by Estimating Twin Class Distributions

Feng Wang, Tao Kong|arXiv (Cornell University)|Oct 14, 2021
Domain Adaptation and Few-Shot Learning参考文献 58被引用数 6
ひとこと要約

Twistは、自己教師あり表現学習手法であり、拡張されたビューから二重の分類分布を推定することで、ラベルなし画像を分類し、相互情報の最大化により崩壊解を防ぐ。SOTA性能を達成しており、ラベルが1%のみのImageNetで61.2%のトップ1精度を達成し、半教師あり学習において前人を6.2ポイント上回る。

ABSTRACT

We present TWIST, a simple and theoretically explainable self-supervised representation learning method by classifying large-scale unlabeled datasets in an end-to-end way. We employ a siamese network terminated by a softmax operation to produce twin class distributions of two augmented images. Without supervision, we enforce the class distributions of different augmentations to be consistent. However, simply minimizing the divergence between augmentations will cause collapsed solutions, i.e., outputting the same class probability distribution for all images. In this case, no information about the input image is left. To solve this problem, we propose to maximize the mutual information between the input and the class predictions. Specifically, we minimize the entropy of the distribution for each sample to make the class prediction for each sample assertive and maximize the entropy of the mean distribution to make the predictions of different samples diverse. In this way, TWIST can naturally avoid the collapsed solutions without specific designs such as asymmetric network, stop-gradient operation, or momentum encoder. As a result, TWIST outperforms state-of-the-art methods on a wide range of tasks. Especially, TWIST performs surprisingly well on semi-supervised learning, achieving 61.2% top-1 accuracy with 1% ImageNet labels using a ResNet-50 as backbone, surpassing previous best results by an absolute improvement of 6.2%. Codes and pre-trained models are given on: https://github.com/bytedance/TWIST

研究の動機と目的

  • 複雑なアーキテクチャやクラスタリングに依存せずに、崩壊解を回避するシンプルで理論的根拠のある自己教師あり学習手法を開発すること。
  • ソフトマックス出力を持つシアンプスネットワークを用いて、ラベルなしの大規模データセットを分類することで、エンドツーエンドの表現学習を可能にすること。
  • 負例、モーメンタムエンコーダー、または勾配停止操作といった明示的な監督信号の必要性を排除すること。
  • 入力画像と予測の間の相互情報の最大化により、半教師あり学習の性能を向上させること。
  • 予測の鋭さと多様性をバランスさせる統一的で説明可能な損失関数を提供すること。

提案手法

  • Twistは、同一画像の2つの拡張ビューから二重の分類分布を生成する共有重みを持つシアンプスネットワークを用いる。
  • 二重の分布間の一貫性を保つために、交差エントロピー損失を用いてその乖離を最小化する。
  • 崩壊解を防ぐために、入力画像と予測の間の相互情報を最大化する2つの目的を用いる:各サンプルのエントロピーを最小化(鋭さ)し、平均分布エントロピーを最大化(多様性)。
  • 統合された目的関数が、鋭さと多様性の両方を同時に最適化する統一損失関数—Twist損失—を形成する。
  • 訓練の安定化とカラム崩壊の防止のため、ソフトマックス層の前でバッチ正則化を用いるが、これだけでは十分ではない。
  • クラスタリング、モーメンタムエンコーダー、非対称アーキテクチャを必要としないため、よりシンプルでモジュラーである。

実験結果

リサーチクエスチョン

  • RQ1入力画像と分類予測の間の相互情報の最大化は、自己教師あり分類における崩壊解を防げるか?
  • RQ2鋭さと多様性に基づく統一損失関数は、負例やモーメンタムエンコーダーに依存する手法を上回る性能を発揮できるか?
  • RQ3ラベルがわずかにしかない状況で、Twistは半教師あり学習においてどのように性能を発揮するか?
  • RQ4バッチ正則化やマルチクロップデータ拡張といったアーキテクチャ的要素が性能に与える影響は何か?
  • RQ5アーキテクチャの変更なしに、Twistは多様な下流タスクに一般化可能か?

主な発見

  • Twistは、ResNet-50を用いてラベルが1%のみのImageNetで61.2%のトップ1精度を達成し、前人最高の手法を6.2ポイント上回る。
  • 完全に自己教師ありの事前学習において、ImageNetで40.6%のトップ1精度を達成しており、ラベルなしで強力な表現学習が可能であることを示している。
  • アブレーションスタディにより、鋭さと多様性の両方の項が不可欠であることが確認された:多様性項を除去すると性能が低下し、鋭さ項を除去すると勾配崩壊が発生する。
  • マルチクロップデータ拡張と自己ラベリングが併用されると性能が向上し、両方を用いることで最良の結果が得られた。
  • クラス数の変動に対して頑健であり、マルチクロップを用いる場合、4096クラスで最適な性能を発揮する。
  • マルチクロップなしでは、より長いエポック数での学習が性能向上に寄与するが、400エポックを超えると性能の上昇が止まる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。