Skip to main content
QUICK REVIEW

[論文レビュー] Bi-Real Net: Binarizing Deep Network Towards Real-Network Performance

Zechun Liu, Wenhan Luo|arXiv (Cornell University)|Nov 4, 2018
Advanced Vision and Imaging参考文献 48被引用数 8
ひとこと要約

本論文では、各1ビット畳み込み層からの実数値活性化を保持するために、パラメータフリーのショートカット接続を導入することで表現能力を向上させる1ビット畳み込みニューラルネットワーク、Bi-Real Netを提案する。この手法は、18層ネットワークでImageNetで56.4%のトップ1精度、152層ネットワークで64.5%のトップ1精度を達成し、従来のバイナリゼートモデルを著しく上回る最先端の性能を発揮しながら、低メモリかつ低計算コストを維持している。

ABSTRACT

In this paper, we study 1-bit convolutional neural networks (CNNs), of which both the weights and activations are binary. While efficient, the lacking of representational capability and the training difficulty impede 1-bit CNNs from performing as well as real-valued networks. We propose Bi-Real net with a novel training algorithm to tackle these two challenges. To enhance the representational capability, we propagate the real-valued activations generated by each 1-bit convolution via a parameter-free shortcut. To address the training difficulty, we propose a training algorithm using a tighter approximation to the derivative of the sign function, a magnitude-aware gradient for weight updating, a better initialization method, and a two-step scheme for training a deep network. Experiments on ImageNet show that an 18-layer Bi-Real net with the proposed training algorithm achieves 56.4% top-1 classification accuracy, which is 10% higher than the state-of-the-arts (e.g., XNOR-Net) with greater memory saving and lower computational cost. Bi-Real net is also the first to scale up 1-bit CNNs to an ultra-deep network with 152 layers, and achieves 64.5% top-1 accuracy on ImageNet. A 50-layer Bi-Real net shows comparable performance to a real-valued network on the depth estimation task with only a 0.3% accuracy gap.

研究の動機と目的

  • ImageNetのような大規模データセットにおける1ビットCNNとフル精度ネットワークの性能差を解消すること。
  • バイナリゼーションの過程で貴重な情報を失う、標準的な1ビットCNNの表現能力の制限を克服すること。
  • 1ビットネットワークにおけるトレーニングの難易度を軽減し、収束不良や精度低下を防ぐこと。
  • 超高層アーキテクチャ(例:152層)への1ビットネットワークのスケーリングを可能にし、高い精度を維持すること。
  • FPGA評価を通じて、1ビットネットワークのモバイルおよび埋め込みデバイスへの実用的導入可能性を示すこと。

提案手法

  • 各1ビット畳み込み層からの実数値活性化を保持するためのパラメータフリーのショートカットパスを導入し、高精度の特徴情報の保持を実現すること。
  • 1ブロックあたり1層のアーキテクチャを設計し、ブロックの出力である実数値特徴量を次のブロックの実数値特徴量に加算することで、表現力の向上を図ること。
  • バックプロパゲーション中に符号関数の導関数のよりタイトな近似を設計し、勾配の流れを改善すること。
  • 重みの量子化時に元の重みの大きさを保持するためのマグニチュード認識バイナリゼーションを実装すること。
  • 2段階トレーニング方式を提案:まずフル精度ネットワークを事前学習し、その後その重みを用いてバイナリズドバージョンを微調整すること。
  • 深層1ビットネットワークにおけるトレーニングの安定化と収束の向上を図るための新規初期化手法を提案すること。

実験結果

リサーチクエスチョン

  • RQ11ビットCNNは、ImageNetのような大規模ベンチマークでフル精度ネットワークと同等の性能を達成できるか?
  • RQ2追加のパラメータを導入せずに、1ビットCNNの表現能力をどのように向上させられるか?
  • RQ31ビットネットワークの安定化と性能向上に最も効果的なトレーニング技術は何か?
  • RQ41ビットネットワークは、超高層アーキテクチャ(例:152層)にスケーリング可能であり、高い精度を維持できるか?
  • RQ51ビットネットワークは、モバイルおよび埋め込みプラットフォームでどの程度効率的に展開可能か?

主な発見

  • 18層のBi-Real NetはImageNetで56.4%のトップ1精度を達成し、XNOR-Netのような先行研究の最先端手法よりも10%の向上を示した。
  • 152層のBi-Real NetはImageNetで64.5%のトップ1精度を達成し、1ビットCNNがこれほど深い構造にスケーリングされた初の成功事例である。
  • 50層のBi-Real NetはKITTI深度推定ベンチマークで84.9%の精度を達成し、32ビットのResNet-50と比較して僅か0.3%の差にとどまり、同等の性能を発揮した。
  • FPGA上で18層のBi-Real Netは、フル精度バージョンと比較して7.38倍の高速化を達成し、LUTとFFの使用量も削減された。
  • 同じFPGAプラットフォーム上では、バイナリ畳み込み層のみで32ビット畳み込みと比較して15.8倍の高速化が達成された。
  • よりタイトな勾配近似とマグニチュード認識バイナリゼーションを含む本手法のトレーニングアルゴリズムにより、深層1ビットネットワークにおける安定なトレーニングと高い精度が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。