Skip to main content
QUICK REVIEW

[論文レビュー] REPAIR: REnormalizing Permuted Activations for Interpolation Repair

Keller Jordan, Hanie Sedghi|arXiv (Cornell University)|Nov 15, 2022
Advanced Neural Network Applications被引用数 11
ひとこと要約

この論文では、活性化の分散崩壊を是正することで、勾配降下法の解の間の損失障壁を著しく低減するREPAIRという手法を紹介する。REPAIRは事前活性化の再重み付けを実行し、線形補間された深層ニューラルネットワークにおける分散崩壊を緩和する。さまざまなアーキテクチャで60%〜100%の障壁低減を達成し、ResNet50/ImageNetでは74%の障壁低減、ResNet18/CIFAR-10では90%の障壁低減を達成する。これはニューロンアライメントと組み合わせた場合の結果である。

ABSTRACT

In this paper we look into the conjecture of Entezari et al. (2021) which states that if the permutation invariance of neural networks is taken into account, then there is likely no loss barrier to the linear interpolation between SGD solutions. First, we observe that neuron alignment methods alone are insufficient to establish low-barrier linear connectivity between SGD solutions due to a phenomenon we call variance collapse: interpolated deep networks suffer a collapse in the variance of their activations, causing poor performance. Next, we propose REPAIR (REnormalizing Permuted Activations for Interpolation Repair) which mitigates variance collapse by rescaling the preactivations of such interpolated networks. We explore the interaction between our method and the choice of normalization layer, network width, and depth, and demonstrate that using REPAIR on top of neuron alignment methods leads to 60%-100% relative barrier reduction across a wide variety of architecture families and tasks. In particular, we report a 74% barrier reduction for ResNet50 on ImageNet and 90% barrier reduction for ResNet18 on CIFAR10.

研究の動機と目的

  • 標準的な深層ネットワークにおいて、ニューロンアライメントのみではなぜ低障壁線形補間が達成できないかを調査すること。
  • 補間ネットワークにおける性能低下の根本的要因、特に活性化における分散崩壊を特定し、是正すること。
  • アーキテクチャの変更(例:LayerNormの導入)を必要としない汎用的な補正手法を開発すること。
  • REPAIRが標準的なBatchNormネットワークでも低障壁接続性を実現できることを検証し、Entezariら(2021)の置換不変補間に関する仮説を支持すること。
  • REPAIRが、実世界のベンチマークにおいてモデル統合、アンサンブル、ファインチューニングといった実用的応用に与える利点を示すこと。

提案手法

  • REPAIRは、各層ごとに学習されたスケーリング係数を用いて、補間ネットワークの事前活性化を再重み付けすることで、分散崩壊を是正する。
  • この手法は、補間ネットワークの各層の事前活性化出力を正規化に類似した補正を施し、活性化の分散を回復する。
  • REPAIRは、1つのネットワークの隠れユニットをもう一方と一致させるための順列操作(アライメント)の後、補間モデルの評価の前に適用される。
  • スケーリング係数は、補間ネットワーク内の事前活性化の統計に基づいて計算され、補間中に観察された崩壊を効果的に逆転させる。
  • 平均化モデルにおけるBatchNorm統計のリセットというアイデアを一般化し、順列された重みを有する補間モデルに拡張する。
  • REPAIRは、BatchNormやLayerNormを含むさまざまな正規化層と互換性があり、異なるネットワーク幅や深さに対しても有効である。

実験結果

リサーチクエスチョン

  • RQ1なぜニューロンアライメント手法は、理論的には有望であるにもかかわらず、標準的な深層ネットワークでは低障壁線形補間を達成できないのか?
  • RQ2補間ネットワークにおける性能低下の背後にあるメカニズムは何か? そして、それが体系的に是正可能か?
  • RQ3補間ネットワークに対する後処理補正によって、アーキテクチャの変更なしに性能を回復できるか?
  • RQ4REPAIRは、標準的なBatchNormネットワークでも低障壁接続性を実現できるか? これにより、LayerNormを用いた先行研究との不一致が解消されるか?
  • RQ5REPAIRは、分割データで学習されたモデルのアンサンブルや建設的統合といった実用的応用を改善できるか?

主な発見

  • ResNet50/ImageNetでは、REPAIRにより補間障壁が74%低減され、精度が1%未満から56.5%に向上した。
  • CIFAR-10のResNet18では、REPAIRにより障壁が90%低減され、損失障壁が16%から1.5%に低下した。
  • この手法は、補間ネットワークにおける分散崩壊を効果的に是正し、活性化分散を元の水準にほぼ回復した。
  • REPAIRは、従来LayerNormが必要とされた標準的なBatchNormネットワークでも、低障壁接続性を実現できた。
  • 分割データ学習の設定では、REPAIRを適用した補間モデルは、CIFAR-100の全テストセットにおいて両端のモデルを上回り、α=0.3でテスト損失1.30を達成した。これは先行研究の1.73よりも優れた結果である。
  • 性能向上はアーキテクチャを問わず一貫しており、さまざまなネットワーク幅や深さにおいて、障壁低減率が60%〜100%に達した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。