Skip to main content
QUICK REVIEW

[論文レビュー] When Semi-Supervised Learning Meets Transfer Learning: Training Strategies, Models and Datasets

Hong-Yu Zhou, Avital Oliver|arXiv (Cornell University)|Dec 13, 2018
Domain Adaptation and Few-Shot Learning参考文献 39被引用数 16
ひとこと要約

本稿は、事前学習モデルの微調整と半教師あり学習(SSL)を統合する方法を調査し、ソースドメインとターゲットドメインが著しく異なる場合、特に医療画像処理のような低リソースでドメインシフトが生じる状況において、SSLがより大きな効果を発揮することを明らかにした。十分なラベル付きデータが利用可能な状況では、Adam最適化子を用いたPseudo-Labelが、完全に教師ありのベースラインを上回ることを示し、事前学習モデルに対してSSLの有効性が限定的であるという従来の仮定に疑問を呈している。

ABSTRACT

Semi-Supervised Learning (SSL) has been proved to be an effective way to leverage both labeled and unlabeled data at the same time. Recent semi-supervised approaches focus on deep neural networks and have achieved promising results on several benchmarks: CIFAR10, CIFAR100 and SVHN. However, most of their experiments are based on models trained from scratch instead of pre-trained models. On the other hand, transfer learning has demonstrated its value when the target domain has limited labeled data. Here comes the intuitive question: is it possible to incorporate SSL when fine-tuning a pre-trained model? We comprehensively study how SSL methods starting from pretrained models perform under varying conditions, including training strategies, architecture choice and datasets. From this study, we obtain several interesting and useful observations. While practitioners have had an intuitive understanding of these observations, we do a comprehensive emperical analysis and demonstrate that: (1) the gains from SSL techniques over a fully-supervised baseline are smaller when trained from a pre-trained model than when trained from random initialization, (2) when the domain of the source data used to train the pre-trained model differs significantly from the domain of the target task, the gains from SSL are significantly higher and (3) some SSL methods are able to advance fully-supervised baselines (like Pseudo-Label). We hope our studies can deepen the understanding of SSL research and facilitate the process of developing more effective SSL methods to utilize pre-trained models. Code is now available at github.

研究の動機と目的

  • 事前学習重みから微調整されたモデルに半教師あり学習(SSL)を適用した場合、特にランダム初期化からの学習と比較して、SSLが追加の利点をもたらすかどうかを調査すること。
  • トレーニング戦略、モデルアーキテクチャ、データセットのドメインシフトが、事前学習モデルにおけるSSL手法のパフォーマンスに与える影響を分析すること。
  • ソースドメインとターゲットドメインが著しく異なる状況下で、SSLが転移学習をどのように強化するかを特定すること。
  • Pseudo-Label、Mean Teacher、Virtual Adversarial Trainingといった特定のSSL手法が、事前学習モデルと組み合わせてどのように効果を発揮するかを評価すること。

提案手法

  • Pseudo-Label、Mean Teacher、Virtual Adversarial Trainingを含む、さまざまなSSL手法を用いて、ターゲットデータセット上で事前学習済みモデル(例:ResNet-50、Inception-v3、VGG-16)を微調整した。
  • 耐性向上とパフォーマンス向上を目的として、水平反転とランダムトランスレーション(F+T)などのデータ拡張を適用したが、結果を劣化させるノイズベースの拡張は避けていた。
  • 学習率、摂動の大きさ(ε)、平滑化係数(ξ)といったハイパーパrameterを系統立てて変化させ、SSLパフォーマンスへの影響を評価した。
  • 一般化行動の分析のため、検証誤差とトレーニング損失の曲線を用い、Pseudo-LabelのようなSSL手法の正則化効果を特に評価した。
  • 学習率スケジュールと最適化設定(例:Adam対SGD)のアブレーションスタディを実施し、事前学習モデルにおけるパフォーマンス要因を分離した。
  • 標準ベンチマーク(CIFAR-10、CIFAR-100、SVHN)とドメインシフトが生じるデータセット(Indoor67、CUB200、医療画像)を用いてモデルを評価し、転移可能性とドメインギャップの影響を分析した。

実験結果

リサーチクエスチョン

  • RQ1事前学習モデルから微調整されたモデルにSSLを適用した場合、完全に教師ありの微調整と比較して、測定可能なパフォーマンス向上が得られるか?
  • RQ2ソース事前学習データセット(例:ImageNet)とターゲットデータセットとの間のドメインギャップが、SSLの有効性にどのように影響するか?
  • RQ3十分なラベル付きデータが利用可能な状況で、Pseudo-LabelのようなSSL手法が、事前学習モデルに適用された場合、完全に教師ありのベースラインを上回ることができるか?
  • RQ4異なるデータ拡張法とトレーニング戦略が、事前学習モデルにおけるSSL手法のパフォーマンスにどのように影響するか?
  • RQ5微調整時に、Virtual Adversarial Trainingにおけるハイパーパrameter ε や ξ が、SSLパフォーマンスにどの程度影響を与えるか?

主な発見

  • ソースドメインとターゲットドメインが類似している場合(例:ImageNetからCIFAR)、事前学習モデルからの微調整においてSSLの向上は著しく小さく、多くの場合、性能向上が完全に消失する。
  • ソースドメインとターゲットドメインが著しく異なる場合、特にImageNet事前学習がほとんど効果を発揮しない医療画像処理のような状況では、SSLが最大の向上をもたらす。
  • 十分なラベル付きデータが利用可能な状況では、Adam最適化子を用いたPseudo-Labelが、完全に教師ありのベースラインを一貫して上回る。これは、過去の文献においてSSLの有効性が過小評価されている可能性を示唆している。
  • 水平反転とランダムトランスレーション(F+T)の組み合わせが、データ拡張として最も優れたSSLパフォーマンスを発揮するが、ノイズベースの拡張は結果を劣化させる。
  • トレーニングイテレーションを増やすことで、SSL手法間のパフォーマンスばらつきが減少し、VATとPseudo-Labelは長いトレーニングスケジュールで類似した正確性に収束する。
  • 学習率は重要なハイパーパrameterである:不適切な選択(例:5e-2)はInception-v3のパフォーマンスを著しく低下させるが、1e-3に設定すると、さまざまなデータセットで一貫した良好な結果が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。