Skip to main content
QUICK REVIEW

[論文レビュー] Structured Binary Neural Networks for Image Recognition

Bohan Zhuang, Chunhua Shen|arXiv (Cornell University)|Sep 22, 2019
Advanced Neural Network Applications被引用数 7
ひとこと要約

本稿では、完全精度ネットワークをグループに分解し、各グループを複数の同型バイナリブランチで近似する構造的近似手法であるGroupNetを提案する。この手法により、入力に応じた動的でスパースなブランチ実行が可能となり、メモリ使用量を削減するとともに、固定小数点量子化よりも優れたスループットを達成する。画像分類、セマンティックセグメンテーション、オブジェクト検出の分野で最先端の性能を達成した。

ABSTRACT

We propose methods to train convolutional neural networks (CNNs) with both binarized weights and activations, leading to quantized models that are specifically friendly to mobile devices with limited power capacity and computation resources. Previous works on quantizing CNNs often seek to approximate the floating-point information using a set of discrete values, which we call value approximation, typically assuming the same architecture as the full-precision networks. Here we take a novel "structure approximation" view of quantization -- it is very likely that different architectures designed for low-bit networks may be better for achieving good performance. In particular, we propose a "network decomposition" strategy, termed Group-Net, in which we divide the network into groups. Thus, each full-precision group can be effectively reconstructed by aggregating a set of homogeneous binary branches. In addition, we learn effective connections among groups to improve the representation capability. Moreover, the proposed Group-Net shows strong generalization to other tasks. For instance, we extend Group-Net for accurate semantic segmentation by embedding rich context into the binary structure. Furthermore, for the first time, we apply binary neural networks to object detection. Experiments on both classification, semantic segmentation and object detection tasks demonstrate the superior performance of the proposed methods over various quantized networks in the literature. Our methods outperform the previous best binary neural networks in terms of accuracy and computation efficiency.

研究の動機と目的

  • バイナリニューラルネットワークにおける値近似ベースの量子化の限界に取り組むこと。特に、画像分類をはるかに超える複雑なビジョンタスクでは性能が劣ることが多い。
  • 従来の値近似とは対照的に、構造的近似を代替手法として検討し、低ビットネットワーク設計におけるアーキテクチャの柔軟性を高めること。
  • 完全精度モデルを複数のバイナリベースを用いて効果的に再構築できるグループ分解戦略を開発すること。
  • 入力特徴に基づく条件付きブランチ実行によりモデル容量を向上させつつ、計算効率を維持すること。
  • 従来のBNNが限界を示していた、セマンティックセグメンテーションやオブジェクト検出といった密度予測タスクへバイナリニューラルネットワークを拡張すること。

提案手法

  • 完全精度ネットワークをグループに分割し、各グループを一連の同型バイナリブランチで近似するグループ分解戦略であるGroupNetを提案する。
  • エンドツーエンド学習を用いて各グループごとのバイナリベースを最適化し、元のネットワークの表現能力を効果的に再構築できるようにする。
  • 動的条件付き計算を導入し、各グループ内で入力特徴に基づいて部分的なバイナリブランチのみを実行することで、FLOPsを増加させずにモデル容量を向上させる。
  • コンpilation段階で事前に定義されたテンソルライフタイムマッピングを用いたメモリプール戦略を採用し、ブランチ間でのバッファ再利用によってランタイムメモリオーバーヘッドを最小限に抑える。
  • 推論時のメモリ割り当て遅延を低減するため、単一の静的メモリプールを用いたコンパイル段階でのメモリ割り当て戦略を活用する。
  • コンテキスト特徴をバイナリ構造に統合することで、GroupNetフレームワークをセマンティックセグメンテーションに適用し、オブジェクト検出へも拡張する。

実験結果

リサーチクエスチョン

  • RQ1グループ分解による構造的近似は、従来の値近似よりもバイナリニューラルネットワークの学習において優れた性能を発揮するか?
  • RQ2グループベースのバイナリネットワークアーキテクチャは、画像分類、セマンティックセグメンテーション、オブジェクト検出の分野で最先端の性能を達成できるか?
  • RQ3スパースなバイナリブランチの動的実行は、計算効率を維持しつつモデル容量をどのように向上させるか?
  • RQ4固定小数点量子化手法と比較して、GroupNetのランタイムメモリ使用量とスループットのトレードオフはどのようになるか?
  • RQ5バイナリニューラルネットワークは、セマンティックセグメンテーションやオブジェクト検出といった密度予測タスクに効果的に一般化できるか?

主な発見

  • GroupNetは、既存の量子化ネットワークと比較して、ImageNet分類タスクで優れた精度を達成し、ResNet-18を用いたトップ-1精度は72.1%を記録した。
  • 本手法はセマンティックセグメンテーションへの一般化にも効果的であり、PASCAL VOCで71.3%の平均IoUを達成した。これは密度予測タスクにおいて強力な性能を示している。
  • COCOデータセットにおけるオブジェクト検出では、マスクR-CNNを用いて28.5%のAPを達成し、複雑な検出タスクに対しても有効であることが示された。
  • ベース=4の場合、GroupNetのランタイムメモリ消費量は11.24 MBであり、完全精度(83.14 MB)と比較して顕著に低減されており、2ビット固定小数点(6.24 MB)と同等の水準に近い。パラメータ保存に起因するわずかな増加にとどまる。
  • GPUプラットフォームでは、最適化されたメモリ再利用とメモリアクセスオーバーヘッドの低減により、GroupNetは固定小数点量子化よりも優れたランタイム効率を示した。
  • メモリプール戦略により、コンパイル段階で事前にテンソルバッファのマッピングを決定することで、ランタイムメモリ割り当て時間をほぼゼロにまで削減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。