Skip to main content
QUICK REVIEW

[論文レビュー] Non-binary deep transfer learning for image classification

Jo Plested, Xuyang Shen|arXiv (Cornell University)|Jul 19, 2021
Domain Adaptation and Few-Shot Learning参考文献 38被引用数 5
ひとこと要約

この論文は、深層転移学習における2値的パラダイムに挑戦し、層の選択的転送、混合学習率、L2SPとL2正則化の組み合わせといった非2値的ハイパーパramータチューニングのアプローチを提案する。4つの画像分類データセットにおいて、標準の2値的微調整設定を上回る、または最先端に近い性能を達成する。

ABSTRACT

The current standard for a variety of computer vision tasks using smaller numbers of labelled training examples is to fine-tune from weights pre-trained on a large image classification dataset such as ImageNet. The application of transfer learning and transfer learning methods tends to be rigidly binary. A model is either pre-trained or not pre-trained. Pre-training a model either increases performance or decreases it, the latter being defined as negative transfer. Application of L2-SP regularisation that decays the weights towards their pre-trained values is either applied or all weights are decayed towards 0. This paper re-examines these assumptions. Our recommendations are based on extensive empirical evaluation that demonstrate the application of a non-binary approach to achieve optimal results. (1) Achieving best performance on each individual dataset requires careful adjustment of various transfer learning hyperparameters not usually considered, including number of layers to transfer, different learning rates for different layers and different combinations of L2SP and L2 regularization. (2) Best practice can be achieved using a number of measures of how well the pre-trained weights fit the target dataset to guide optimal hyperparameters. We present methods for non-binary transfer learning including combining L2SP and L2 regularization and performing non-traditional fine-tuning hyperparameter searches. Finally we suggest heuristics for determining the optimal transfer learning hyperparameters. The benefits of using a non-binary approach are supported by final results that come close to or exceed state of the art performance on a variety of tasks that have traditionally been more difficult for transfer learning.

研究の動機と目的

  • すべての層を転送するか、まったく転送しないという2値的仮定、および正則化を一様に適用するという仮定を挑戦すること。
  • 下位層(より汎用的な層)の選択的転送が、全層転送よりも性能を向上させるかを調査すること。
  • 非一様な学習率とハイブリッド正則化(L2SP + L2)を、標準の2値的微調整戦略の代替として探ること。
  • 事前学習済み特徴がターゲットデータセットにどれほど適合しているかに基づいて、最適なハイパーパramータを決定するヒューリスティクスを開発すること。
  • 最適なパフォーマンスはデータセット依存であり、非2値的で適応的なハイパーパramータチューニングが必要であることを示すこと。

提案手法

  • 追加の事前学習を伴わない、ImageNet重みを事前学習済みとして用い、4つのデータセット(Caltech, Cars, Aircraft, DTD)で広範な実験的評価を実施した。
  • 異なる層グループ(例:低層 vs. 高層)に別々の学習率を設定し、L2SP正則化を部分的に適用する非伝統的なハイパーパramータ探索戦略を提案した。
  • 異なる層グループにL2SP(事前学習済み重みへの減衰)とL2(ゼロへの減衰)を組み合わせたハイブリッド正則化アプローチを導入した。
  • 固定特徴モデルとランダム初期化モデルのパフォーマンス差をヒューリスティクスとして用い、最適なハイパーパramータ選択を支援した。
  • 特徴の類似度を測定し、層選択を支援するために、Earth Mover’s Distance(EMD)とFisher比を用いた。
  • 固定特徴モデルとランダム初期化モデルのパフォーマンスギャップの符号と大きさに基づくヒューリスティクスを開発し、最適な設定を決定した。

実験結果

リサーチクエスチョン

  • RQ1選択的層転送や混合学習率といった非2値的ハイパーパramータチューニングアプローチが、標準の2値的微調整を上回るパフォーマンスを達成できるか。
  • RQ2異なる層グループにL2SPとL2正則化を組み合わせることで、それぞれを一様に適用するよりも優れた結果が得られるか。
  • RQ3事前学習済み重みがターゲットデータセットにどれほど適合しているかを定量的に測定し、最適なハイパーパramータ設定を導くためにどう利用できるか。
  • RQ4膨大なハイパーパramータサーチを実施せずに、最適な転移学習設定を予測する信頼性のあるヒューリスティクスは存在するか。
  • RQ5ソースデータセットとターゲットデータセットの類似度が、最適な転移学習ハイパーパramータの選択にどの程度影響を及けるか。

主な発見

  • Caltech-101では、1つの新しい層に学習率0.0025とL2SP正則化を適用した最適設定で85.94%の正確度を達成し、デフォルト設定(84.52%)と最先端(84.9%)を上回った。
  • Carsデータセットでは、1つの新しい層に高い学習率(0.025)を下位層に、低い学習率(0.01)を上位層に適用した最適設定で95.35%の正確度を達成し、デフォルト(94.86%)と最先端(96.0%)を上回った。
  • Aircraftでは、3つの新しい層に最終層で学習率0.01、上位層で0.025を適用した最適設定で94.50%の正確度を達成し、デフォルト(94.42%)と最先端(93.9%)を上回った。
  • DTDでは、2つの新しい層に学習率0.002と、14層にL2SP正則化を適用した最適設定で78.90%の正確度を達成し、最先端(78.9%)と同等の性能を示した。
  • 固定特徴モデルとランダム初期化モデルのパフォーマンスギャップは、最適なハイパーパramータの予測に強く寄与しており、負のギャップはより多くの層の再初期化を示し、正のギャップはL2SPの適用を示唆した。
  • EMD類似度測定はハイパーパラメータ選択を支援するのに信頼性が低く、正規化されたFisher比は限定的ではあるが、使用可能な予測力を持っていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。