Skip to main content
QUICK REVIEW

[論文レビュー] Self-Adaptive Training: Bridging Supervised and Self-Supervised Learning

Lang Huang, Chao Zhang|arXiv (Cornell University)|Jan 21, 2021
Machine Learning and Data Classification参考文献 83被引用数 6
ひとこと要約

本稿では、追加の計算コストなしにモデルの予測を自己適応的监督信号として活用することで、トレーニングを動的に向上させる統合的深層学習フレームワーク「自己適応トレーニング」を提案する。この手法はラベルノイズ下でも一般化性能を向上させ、自己教師あり表現学習を強化し、CIFAR、STL、ImageNetデータセットにおけるノイズあり分類、選択的分類、線形評価の分野で最先端の結果を達成する。

ABSTRACT

We propose self-adaptive training -- a unified training algorithm that dynamically calibrates and enhances training processes by model predictions without incurring an extra computational cost -- to advance both supervised and self-supervised learning of deep neural networks. We analyze the training dynamics of deep networks on training data that are corrupted by, e.g., random noise and adversarial examples. Our analysis shows that model predictions are able to magnify useful underlying information in data and this phenomenon occurs broadly even in the absence of any label information, highlighting that model predictions could substantially benefit the training processes: self-adaptive training improves the generalization of deep networks under noise and enhances the self-supervised representation learning. The analysis also sheds light on understanding deep learning, e.g., a potential explanation of the recently-discovered double-descent phenomenon in empirical risk minimization and the collapsing issue of the state-of-the-art self-supervised learning algorithms. Experiments on the CIFAR, STL, and ImageNet datasets verify the effectiveness of our approach in three applications: classification with label noise, selective classification, and linear evaluation. To facilitate future research, the code has been made publicly available at https://github.com/LayneH/self-adaptive-training.

研究の動機と目的

  • データの損傷、たとえばラベルノイズや敵対的例の下でも、深層ニューラルネットワークの一般化性能の低さという課題に対処すること。
  • モデルの予測が、教師あり学習と自己教師あり学習の両方のトレーニングダイナミクスを向上させる普遍的信号として機能できるかどうかを調査すること。
  • 最適化に予測を動的に統合することで、教師あり学習と自己教師あり学習を統合するトレーニングアルゴリズムを開発すること。
  • マルチビューの増強や反復的自己トレーニングを必要とする従来の手法の限界を克服し、計算コストの高い処理を回避すること。
  • 理論的裏付けが強く、計算効率の高い、従来の頑健な学習および自己教師あり学習手法の代替手段を提供すること。

提案手法

  • モデルの予測の指数的移動平均を用いて、トレーニング用のソフトラベルを生成する自己適応トレーニングアルゴリズムを導入する。
  • 予測の信頼度に基づいてサンプルを動的に再重み付けすることで、最適化中にノイズが多いまたは誤った予測の影響を低減する。
  • 真のラベルが存在しない状況では、モデルの予測を仮ラベルとして扱うことで、教師ありおよび自己教師ありの両設定にこの手法を適用する。
  • アーキテクチャの変更なしに、標準的なネットワークアーキテクチャおよび損失関数(例:交差エントロピー)と互換性を保つ。
  • 1ステップのトレーニングごとに1回の順方向伝搬のみを実行し、標準トレーニングを超える追加の計算コストを発生させない。
  • 同じ予測に基づく監視を一貫して適用することで、ラベルノイズ環境と自己教師あり環境の両方でこの手法が機能するようにする。
(a) Accuracy curves of the model trained by ERM.
(a) Accuracy curves of the model trained by ERM.

実験結果

リサーチクエスチョン

  • RQ1ラベルが損傷している、あるいは存在しない場合でも、モデルの予測がデータに内在する有用な情報を強化できるか?
  • RQ2トレーニングにモデルの予測を組み込むことで、ラベルノイズ下の深層ネットワークにおける一般化性能が向上するか?
  • RQ3統合的なトレーニングアルゴリズムが、教師あり学習と自己教師あり学習のパラダイムを効果的に統合できるか?
  • RQ4自己適応トレーニングは、既存の頑健な学習および自己教師あり学習手法と比較して、性能と効率の面で優れているか?
  • RQ5自己適応トレーニングは、自己教師あり学習で観察される二重降下現象や崩壊問題を緩和するか?

主な発見

  • 標準的なERMトレーニングと比較して、40%のラベルノイズを伴うCIFAR-10では、バリデーション精度が10%以上向上した。
  • 本手法は単一降下の誤差・容量曲線を示したのに対し、標準的なERMでは二重降下の挙動が観察された。これは、より優れた一般化ダイナミクスを示唆している。
  • ImageNetにおける線形評価プロトコルでは、自己適応トレーニングが自己教師あり表現学習の性能を顕著に向上させた。
  • 本手法は、選択的分類およびノイズありラベル学習の分野で、既存の手法を上回り、多様なデータ損傷タイプにわたる頑健性を示した。
  • 実験により、真のラベルが一切存在しない状況でも、モデルの予測だけを用いても効果的な学習が可能であることが示され、予測への情報抽出という核心仮説が裏付けられた。
  • 本手法は追加の計算コストを発生せず、標準的なトレーニングパイプラインと互換性があるため、広範な適用が可能である。
(b) Accuracy curves of the model trained by our method.
(b) Accuracy curves of the model trained by our method.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。