Skip to main content
QUICK REVIEW

[論文レビュー] High-Capacity Expert Binary Networks

Adrian Bulat, Brais Martínez|arXiv (Cornell University)|Oct 7, 2020
Energy Efficient Wireless Sensor Networks参考文献 56被引用数 4
ひとこと要約

この論文は、3つの主要なイノベーションを通じてバイナリニューラルネットワークの性能を向上させる、新しいフレームワークであるHigh-Capacity Expert Binary Networksを提案する。具体的には、入力に応じた動的フィルタ選択を可能にするExpert Binary Convolution、計算量を増加させずに表現能力を向上させる効率的な幅拡張メカニズム、および最適なバイナリネットワークアーキテクチャを体系的かつ原理的かつに探索する手法である。本手法は、計算コストを増加させることなくImageNetで71%のトップ-1精度を達成し、先行研究より6%高い性能を示した。

ABSTRACT

Network binarization is a promising hardware-aware direction for creating efficient deep models. Despite its memory and computational advantages, reducing the accuracy gap between binary models and their real-valued counterparts remains an unsolved challenging research problem. To this end, we make the following 3 contributions: (a) To increase model capacity, we propose Expert Binary Convolution, which, for the first time, tailors conditional computing to binary networks by learning to select one data-specific expert binary filter at a time conditioned on input features. (b) To increase representation capacity, we propose to address the inherent information bottleneck in binary networks by introducing an efficient width expansion mechanism which keeps the binary operations within the same budget. (c) To improve network design, we propose a principled binary network growth mechanism that unveils a set of network topologies of favorable properties. Overall, our method improves upon prior work, with no increase in computational cost, by $\sim6 \%$, reaching a groundbreaking $\sim 71\%$ on ImageNet classification. Code will be made available $\href{https://www.adrianbulat.com/binary-networks}{here}$.

研究の動機と目的

  • ハードウェア効率の高さにもかかわらず、実用的導入が制限されるバイナリニューラルネットワークとそのフル精度版との間の持続的な精度格差を是正すること。
  • 活性化関数と重みを±1に制限することに起因するバイナリネットワーク固有の情報ボトルネックを克服すること。
  • 計算複雑度を増加させずにモデル容量と表現能力を向上させることで、リソース制約のあるデバイス上での実用的導入を可能にすること。
  • 優れた性能特性を示すアーキテクチャを体系的かつ原理的かつに同定するバイナリネットワークアーキテクチャ探索のためのアプローチを開発すること。
  • 従来の手法と同等の計算予算を維持しながら、バイナリImageNet分類において最先端の精度を達成すること。

提案手法

  • 各レイヤーに対してN個のバイナリフィルタエキスパートを学習し、入力特徴に基づいて入力毎に1つのエキスパートを軽量なゲーティングネットワークを用いて動的に選択する条件付き計算メカニズムであるExpert Binary Convolutionを提案する。
  • 計算量を増加させずに、効率的なビット演算を活用してチャンネル数を増加させることで、元の計算予算を保ちながらバイナリネットワークの有効な幅を拡張するメカニズムを導入する。
  • Tan & Le (2019)のアプローチをバイナリネットワークに適応させた、最適なアーキテクチャ構成を固定された計算制約下で精度を最大化するように探索するバイナリネットワーク探索フレームワークを設計する。
  • PReLU活性化関数、スキップ接続、2段階訓練、および実数→バイナリ知識蒸留といった既存の技術を統合し、訓練の安定性と一般化性能の向上を図る。
  • 最初のレイヤーと最後のレイヤー、バッチ正規化、スケーリング要因のみをフル精度に保ち、すべての畳み込みレイヤーをバイナリ化することで効率性を維持するハイブリッドネットワーク構造を採用する。
  • データ駆動型チャンネルリスケーリングとフル精度の教師モデルを用いた知識蒸留を適用し、さらに精度格差を縮小する(結果にアsteriskを付記)。

実験結果

リサーチクエスチョン

  • RQ1条件付き計算がバイナリニューラルネットワークに効果的に適用可能であり、入力固有のエキスパート選択によってモデル容量を向上させることができるか?
  • RQ2計算量を増加させずにバイナリネットワークの有効な幅を拡張することは、表現能力と精度を顕著に向上させることができるか?
  • RQ3体系的な探索戦略が、同じ計算予算下で既存の設計を上回る性能を示すバイナリネットワークアーキテクチャを同定できるか?
  • RQ4知識蒸留およびスキップ接続やPReLUsといったアーキテクチャ的変更が、バイナリモデルとフル精度モデルの間の精度格差をどの程度縮小できるか?
  • RQ5FLOPsやモデルサイズを増加させることなく、バイナリネットワークでImageNet分類の最先端精度を達成することは可能か?

主な発見

  • 提案手法は、ImageNetで71%のトップ-1精度を達成した。これは、Martinezら(2020)が達成した約65%の先行最先端手法よりも約6%高い。
  • Expert Binary Convolutionにより、入力に応じた動的で条件付きのフィルタ選択が可能となり、各入力が専用のバイナリフィルタで処理されるようになり、一般化性能とモデル容量が向上した。
  • 幅拡張メカニズムにより、計算予算を維持したままチャンネル数を増加させることで有効な容量を拡大し、顕著な精度向上が得られた。
  • 2段階訓練、PReLU活性化関数、スキップ接続、知識蒸留の組み合わせにより、訓練の安定性と最終的な性能が顕著に向上した。
  • 最良のバイナリモデルとそのフル精度教師モデルとの間の精度格差は、約3.5–4%にまで縮小された。これは、先行最先端手法の約5%と比較して顕著な改善を示し、優れた知識蒸留とモデル整合性を示している。
  • 本手法は一般化性に優れている:バイナリ設定だけでなく、フル精度設定でも良好な性能を示しており、バイナリ化が容易なモデルは、本質的にフル精度学習に対しても良好な構造を持っていることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。