Skip to main content
QUICK REVIEW

[論文レビュー] Regularized Binary Network Training

Sajad Darabi, Mouloud Belbahri|arXiv (Cornell University)|Dec 31, 2018
Advanced Neural Network Applications参考文献 13被引用数 7
ひとこと要約

本論文は、より良い勾配近似のための新しい SignSwish 活性化関数、±1 に近い重みを促進する学習可能な正則化関数、および各層ごとの学習可能なスケーリング係数を導入することで、収束性と精度を向上させる正則化付きバイナリネットワーク学習手法を提案する。この手法は ImageNet において最先端の性能を達成し、AlexNet ではトップ1精度 46.1%、ResNet-18 では 53.0% を記録し、XNOR-Net や BinaryNet を上回った。

ABSTRACT

There is a significant performance gap between Binary Neural Networks (BNNs) and floating point Deep Neural Networks (DNNs). We propose to improve the binary training method, by introducing a new regularization function that encourages training weights around binary values. In addition, we add trainable scaling factors to our regularization functions. Additionally, an improved approximation of the derivative of the sign activation function in the backward computation. These modifications are based on linear operations that are easily implementable into the binary training framework. Experimental results on ImageNet shows our method outperforms the traditional BNN method and XNOR-net.

研究の動機と目的

  • リソース制約のあるデバイスにおけるバイナリニューラルネットワーク(BNN)とフル精度DNNの間の性能ギャップを埋めること。
  • バックプロパゲーション中に ±1 の近辺で勾配飽和が生じるため、BNN学習における不安定性と収束性の悪さを解消すること。
  • 新しい正則化関数により重みが ±1 に収束するよう促進することで、バイナリネットワークの一般化性能とロバスト性を向上させること。
  • ハードバイナリゼーションによる精度低下を軽減するため、各層またはフィルタごとに学習可能なスケーリング係数を導入すること。

提案手法

  • Swish から導出された微分可能で有界な活性化関数である SignSwish(SSwish)を導入し、±1 の近辺での勾配流れを改善するための学習可能なスケール β を備える。
  • 重みが ±1 に収束するよう促進するための新しい正則化関数 R₁(w) = |α − |w||(マンハッタン)および R₂(w) = (α − |w|)²(ユークリッド)を提案する。ここで α は各層ごとの学習可能なスケールである。
  • 正則化項を総損失関数に統合し、J(W,b) = L(W,b) + λₜ∑ₕ R(Wₕ,αₕ) として、重みとスケーリング係数の共同最適化を可能にする。
  • R₁ と R₂ それぞれに対して、|W| の中央値または平均を α* の初期化に用いることで、初期化が正則化目的と整合するようにする。
  • 活性化関数の前段にバッチ正則化を適用し、最初および最後の層をフル精度に保つことで精度を維持する。これは従来のBNN手法と一貫している。
  • アブレーションスタディでは β を固定値に設定し、β を調整することで勾配飽和の発生位置を制御し、学習安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1学習可能な有界活性化関数は、標準的なストレートスルー推定器(STE)と比較して、バイナリニューラルネットワークにおける勾配近似を改善できるか?
  • RQ2±1 からの逸脱をペナルティ化する正則化関数は、バイナリネットワーク学習における収束性と精度を向上させられるか?
  • RQ3各層またはフィルタごとの学習可能なスケーリング係数は、ハードバイナリゼーションによる精度損失を軽減できるか?
  • RQ4改善された勾配近似、正則化、スケーリング係数の組み合わせが、既存のBNN手法と比較して ImageNet での性能にどのように影響を与えるか?

主な発見

  • 提案手法は、AlexNet を用いて ImageNet でトップ1精度 46.1% を達成し、XNOR-Net(44.2%)および BinaryNet(41.2%)を上回った。
  • ResNet-18 ではトップ1精度 53.0% を記録し、XNOR-Net(51.2%)および BinaryNet(42.2%)を上回った。
  • β=10 の SignSwish を使用した場合が最良の性能を示し、標準的な STE よりも ±1 の近辺での勾配流れが向上していることが確認された。
  • R₁ 正則化と SignSwish(β=10)の組み合わせが、両アーキテクチャで最高の精度を達成しており、重みが ±1 に適切にクラスタリングされていることが示された。
  • アブレーションスタディにより、SignSwish、正則化、スケーリング係数の3要素が相乗的に性能向上に寄与していることが確認された。
  • 最初および最後の層をフル精度に保った場合でも、高い性能を維持しており、従来のBNNの実装と整合しており、安定性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。