Skip to main content
QUICK REVIEW

[論文レビュー] Distance-Based Regularisation of Deep Networks for Fine-Tuning

Henry Gouk, Timothy M. Hospedales|arXiv (Cornell University)|Feb 19, 2020
Advanced Neural Network Applications参考文献 35被引用数 6
ひとこと要約

本稿では、MARS(最大絶対行和)ノルムを用いて、事前学習済み重みの周囲の小さな球内に重み更新を制約することにより、深層ニューラルネットワークの微調整のための距離に基づく正則化手法を提案する。理論的および実験的に、MARSに基づく制約がユークリッド距離ペナルティや標準的な微調整を上回ることを示し、画像分類ベンチマークでより優れた一般化性能と最先端の性能を達成している。

ABSTRACT

We investigate approaches to regularisation during fine-tuning of deep neural networks. First we provide a neural network generalisation bound based on Rademacher complexity that uses the distance the weights have moved from their initial values. This bound has no direct dependence on the number of weights and compares favourably to other bounds when applied to convolutional networks. Our bound is highly relevant for fine-tuning, because providing a network with a good initialisation based on transfer learning means that learning can modify the weights less, and hence achieve tighter generalisation. Inspired by this, we develop a simple yet effective fine-tuning algorithm that constrains the hypothesis class to a small sphere centred on the initial pre-trained weights, thus obtaining provably better generalisation performance than conventional transfer learning. Empirical evaluation shows that our algorithm works well, corroborating our theoretical results. It outperforms both state of the art fine-tuning competitors, and penalty-based alternatives that we show do not directly constrain the radius of the search space.

研究の動機と目的

  • 初期値からの重みの移動を制御することで一般化性能を向上させる理論的根拠に基づいた微調整のための正則化戦略を開発すること。
  • 異なる距離計測基準(例:MARS対ユークリッド)を用いた距離ベースの正則化が微調整においてより優れた性能をもたらすかどうかを調査すること。
  • 損失関数に基づくペナルティ正則化とトレーニング中の重み距離に対するハード制約の有効性を比較すること。
  • 初期値からの重みの移動距離に明示的に依存するが、被覆数やモデル分布に依存しない、ラデマッハ複雑度に基づく新しい一般化境界を提示すること。
  • MARSに基づく制約が、実際の微調整において標準的な微調整やペナルティベースの代替手法を上回ることを実験的に検証すること。

提案手法

  • MARSおよびフロベニウスノルムを用いて、最終重みが初期値からどれだけ移動したかに依存する、新たなラデマッハ複雑度一般化境界を導出する。
  • 2つのプロジェクションベースの微調整アルゴリズム、MARS-PGMおよびℓ²-PGMを提案する。これらは、投影勾配法を用いてそれぞれMARS距離およびユークリッド距離にハード制約を課す。
  • 損失関数内でMARS距離を正則化するペナルティベースの手法を提案し、制約ベースの手法との比較のためのベースラインとする。
  • 標準的なCNNアーキテクチャを用いてMNIST上で境界と手法の実験的評価を行い、トレーニング全体を通してモデルの複雑度と一般化性能を測定する。
  • 早期停止と非正則化トレーニングをベースラインとして用い、暗黙の正則化効果を評価し、明示的正則化戦略を比較する。
  • Adam最適化法を用い、トレーニング全体を通してテスト精度とモデル複雑度のメトリクスを評価し、一般化性能および制約の有効性を評価する。

実験結果

リサーチクエスチョン

  • RQ1初期値からの重み移動距離に基づく一般化境界は、従来の境界と比較して、よりタイトで関連性の高い性能保証を提供するか?
  • RQ2畳み込みニューラルネットワークの重み空間における距離測定に、フロベニウスノルムやスペクトルノルムと比較してMARSノルムがより適しているか?
  • RQ3プロジェクションを用いたハード制約による重み距離の制御が、ペナルティベースの正則化を上回る性能を発揮するか?
  • RQ4MARSに基づく正則化は、標準的な微調整や既存の最先端手法と比較して、より優れたテスト性能をもたらすか?
  • RQ5早期停止による暗黙の正則化が、モデル複雑度と一般化の観点から、明示的正則化戦略とどのように相互作用するか?

主な発見

  • MARSに基づく一般化境界は、フロベニウスノルムやスペクトルノルムに基づく境界と比較して、特に畳み込みネットワークの文脈において顕著にタイトである。
  • 実験的評価により、MARS-PGM(MARS制約付きの投影勾配法)がMNISTにおいてℓ²-PGMおよび標準的な微調整を上回り、より高いテスト精度と優れた一般化性能を達成した。
  • ペナルティベースの正則化でさえ、制約半径に合わせてチューニングされたとしても、プロジェクション法によるハード制約が優れた性能を発揮した。
  • MARS距離を正則化のメトリクスとして用いることで、特に畳み込みアーキテクチャにおいて、ユークリッド距離よりも効果的な仮説クラスの制限が達成された。
  • ハイパーパrameterが増加してもモデル複雑度の測定値がトレーニング中に plateau に達する傾向にあり、早期停止による暗黙の正則化が明示的正則化の効果を隠蔽している可能性を示唆した。
  • 提案されたMARS-PGM手法は、微調整ベンチマークで最先端の性能を達成し、深層学習における制約ベースの正則化がペナルティベースの代替手法を上回ることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。