[論文レビュー] Towards Lossless Binary Convolutional Neural Networks Using Piecewise Approximation
この論文は、複数のバイナリ畳み込みニューラルネットワーク向けに、全精度重みと活性化を複数の断片に分割し、それぞれをスケーリング係数で近似するピecewise Approximation (PA) 方式を提案する。これにより、並列ビット単位演算を維持しながら、精度損失を低減できる。この手法は、ImageNet において全精度 ResNet と比較してトップ-1 精度ギャップがわずか ~1.0% に抑えられ、Bi-Real Net よりも低いメモリ使用量と FLOPs を達成しており、従来の単一および複数バイナリ CNN より優れた性能を発揮する。
Binary Convolutional Neural Networks (CNNs) can significantly reduce the number of arithmetic operations and the size of memory storage, which makes the deployment of CNNs on mobile or embedded systems more promising. However, the accuracy degradation of single and multiple binary CNNs is unacceptable for modern architectures and large scale datasets like ImageNet. In this paper, we proposed a Piecewise Approximation (PA) scheme for multiple binary CNNs which lessens accuracy loss by approximating full precision weights and activations efficiently and maintains parallelism of bitwise operations to guarantee efficiency. Unlike previous approaches, the proposed PA scheme segments piece-wisely the full precision weights and activations, and approximates each piece with a scaling coefficient. Our implementation on ResNet with different depths on ImageNet can reduce both Top-1 and Top-5 classification accuracy gap compared with full precision to approximately 1.0%. Benefited from the binarization of the downsampling layer, our proposed PA-ResNet50 requires less memory usage and two times Flops than single binary CNNs with 4 weights and 5 activations bases. The PA scheme can also generalize to other architectures like DenseNet and MobileNet with similar approximation power as ResNet which is promising for other tasks using binary convolutions. The code and pretrained models will be publicly available.
研究の動機と目的
- ImageNet などの大規模データセットに展開された際の単一および複数バイナリ CNN における高い精度低下を是正すること。
- 推論効率を維持するためのビット単位演算の並列性を保ちながら、既存の複数バイナリ CNN よりも高い近似精度を実現する手法を開発すること。
- 全精度ネットワークとバイナリネットワークの間の精度ギャップを、計算またはメモリ効率を犠牲にせずに低減すること。
- ResNet、DenseNet、MobileNet などの多様なアーキテクチャに一般化可能なアプローチを提供すること。
提案手法
- PA 方式は、重みと活性化の全精度範囲を複数の連続する断片に分割する。
- 各断片は学習可能なスケーリング係数で近似され、順伝播および逆伝播の過程で効率的かつ微分可能に近似が可能になる。
- 全精度値を区分的線形関数で表現することで、推論時に並列ビット単位演算を実現できる。
- 1×1 ダウンサンプリング層のバイナリゼーションを統合することで、さらにメモリ使用量と FLOPs を削減する。
- すべての断片における残差誤差を最小化する損失関数を用いて、エンド・ツー・エンドで訓練する。
- 重みと活性化に複数のベース(例:重みに 4 つ、活性化に 5 つ)をサポートすることで、細分化された近似を可能にする。
実験結果
リサーチクエスチョン
- RQ1ピースワイズ近似方式は、複数バイナリ CNN の精度劣化を低減させつつ、ビット単位演算の効率性を維持できるか?
- RQ2ImageNet における精度と計算効率の観点から、PA 方式は単一バイナリ CNN や他の複数バイナリ CNN と比べてどのように差をつけるか?
- RQ3PA 方式は、ResNet や DenseNet、MobileNet といった異なる CNN アーキテクチャにどの程度一般化可能か?
- RQ4PA フレームワーク内でのダウンサンプリング層のバイナリゼーションが、メモリ使用量と FLOPs に与える影響は何か?
主な発見
- PA-ResNet50 は、全精度 ResNet と比較して、ImageNet におけるトップ-1 精度ギャップを約 1.0% にまで低減した。
- 重みに 4 個、活性化に 5 個のベースを用いた場合、PA-ResNet50 は Bi-Real Net よりも低いメモリ使用量と、わずか 2 倍の FLOPs で、かつより深い構造であるにもかかわらず優れた性能を発揮した。
- PA 方式は、ABC-Net や他の複数バイナリ CNN よりも精度が高く、かつビット単位演算の並列性を維持している。
- 本手法は他のアーキテクチャに対しても良好に一般化され、ResNet と同程度の近似性能を DenseNet や MobileNet でも達成した。
- PA-ResNet50 はメモリ使用量がわずか 40.33 Mbit に抑えられ、全精度 ResNet50 よりも FLOPs を約 3 倍削減した。
- カスタムハードウェア上では、PA-Net のレイテンシコストは Bi-Real Net に対してわずか 4T_mul + 4T_add + T_com の増加に抑えられ、高い効率性の潜在的価値を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。