Skip to main content
QUICK REVIEW

[論文レビュー] Structured Binary Neural Networks for Accurate Image Classification and Semantic Segmentation

Bohan Zhuang, Chunhua Shen|arXiv (Cornell University)|Nov 22, 2018
Advanced Neural Network Applications参考文献 53被引用数 16
ひとこと要約

この論文では、完全精度の畳み込み層を複数の並列なバイナリブランチに分解することで、画像分類およびセマンティックセグメンテーションにおける精度と効率を向上させる構造的バイナリニューラルネットワーク、Group-Netを提案する。相互のグループ間接続を学習し、アトラス空間ピラミッドプーリング(Atrous Spatial Pyramid Pooling)のようなタスク固有の構造を統合することで、計算コストを著しく削減しつつ、バイナリネットワーク分野で最先端のパフォーマンスを達成する。

ABSTRACT

In this paper, we propose to train convolutional neural networks (CNNs) with both binarized weights and activations, leading to quantized models specifically} for mobile devices with limited power capacity and computation resources. Previous works on quantizing CNNs seek to approximate the floating-point information using a set of discrete values, which we call value approximation, but typically assume the same architecture as the full-precision networks. In this paper, however, we take a novel 'structure approximation' view for quantization---it is very likely that a different architecture may be better for best performance. In particular, we propose a `network decomposition' strategy, named extbf{Group-Net}, in which we divide the network into groups. In this way, each full-precision group can be effectively reconstructed by aggregating a set of homogeneous binary branches. In addition, we learn effective connections among groups to improve the representational capability. Moreover, the proposed Group-Net shows strong generalization to other tasks. For instance, we extend Group-Net for highly accurate semantic segmentation by embedding rich context into the binary structure. Experiments on both classification and semantic segmentation tasks demonstrate the superior performance of the proposed methods over various popular architectures. In particular, we outperform the previous best binary neural networks in terms of accuracy and major computation savings.

研究の動機と目的

  • バイナリニューラルネットワーク(BNN)における極端な重みと活性化の量子化が引き起こす性能低下を是正すること。
  • 量子化における値の近似の限界を克服するため、新しい構造的近似パラダイムを提案すること。
  • 標準的な量子化よりも高レベルの構造的情報をよりよく保持する、柔軟でタスク適応型のバイナリアーキテクチャを設計すること。
  • 計算コストを増加させることなく、セマンティックセグメンテーションのような複雑なタスクにBNNを拡張すること。
  • 構造的設計が標準的な量子化を上回ることを示し、ハードウェア効率を維持したままであること。

提案手法

  • 全精度層をグループに分割し、それぞれを同型のバイナリブランチで近似するネットワーク分解戦略、Group-Netを提案する。
  • 効果的なグループ間接続を学習するためのファージョンゲートメカニズムを導入し、表現能力を向上させる。
  • セマンティックセグメンテーションのためのタスク固有の誘導的バイアス(例:アトラス空間ピラミッドプールイング(ASPP))を直接バイナリバックボーンに組み込む。
  • 非微分可能なバイナリゼーション操作を経由する勾配の誤差逆伝播を可能にするため、微分可能なストレートスラッシュ推定器(STE)を用いる。
  • 活性化の動的範囲を制限し、低ビット幅の活性化における量子化誤差を低減するため、クリップ関数を用いた均一な量子化を採用する。
  • 重みをバイナリに保ちつつ、活性化を2〜4ビットなどの高ビット幅に許容する混合精度設定をサポートする。

実験結果

リサーチクエスチョン

  • RQ1再構築されたバイナリアーキテクチャは、標準的な値近似に基づく量子化を上回る性能を発揮できるか?
  • RQ2学習可能なグループ間接続を持つバイナリグループへのネットワーク分解は、画像分類およびセグメンテーションの性能向上に寄与するか?
  • RQ3タスク固有の誘導的バイアス(例:ASPP)をバイナリネットアーキテクチャに効果的に埋め込むことができるか、セグメンテーション精度の向上に寄与するか?
  • RQ4Group-Netにおける1グループあたりのバイナリベース数は、精度とモデル容量にどのように影響するか?
  • RQ5Group-Netは、異なるネットワークアーキテクチャ(例:ResNet、AlexNet)およびタスク(分類、セグメンテーション)に一般化可能か?

主な発見

  • ResNet-50を用いて、バイナリ重みと4ビット活性化でImageNetで76.0%のトップ-1精度を達成し、完全精度モデルと同等の性能を発揮する。
  • ResNet-18では、バイナリ重みと4ビット活性化で70.1%のトップ-1精度を達成し、ベースラインのLBDより10.0ポイント高い性能を発揮する。
  • 5つのバイナリベースと4ビット活性化を用いることで、ResNet-18で70.4%のトップ-1精度を達成し、完全精度モデルからわずか0.7%の差にとどまる。
  • セマンティックセグメンテーションにおいて、バイナリバックボーンにASPPを埋め込むことで、計算コストを増加させることなく性能が向上する。
  • モデルは良好に一般化される:ResNet-18を用いて、バイナリ重みと2ビット活性化で69.6%のトップ-1精度を達成し、完全精度モデルから0.1%の低下にとどまる。
  • 実験により、微調整よりもスクラッチからの学習がより優れた結果をもたらすことが示され、異なるネットワークの深さやビット幅に対してもモデルは頑健である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。