Skip to main content
QUICK REVIEW

[論文レビュー] Big-Little Net: An Efficient Multi-Scale Feature Representation for Visual and Speech Recognition

Chun-Fu Chen, Quanfu Fan|arXiv (Cornell University)|Jul 10, 2018
Advanced Image and Video Retrieval Techniques参考文献 53被引用数 60
ひとこと要約

Big-Little Net (bL-Net) は高解像度特徴と低解像度特徴を融合する二分岐のマルチスケールアーキテクチャを用い、視覚タスクで精度を向上させつつFLOPを大幅に削減し、音声認識では30%のFLOPs節約でWERを改善する。

ABSTRACT

In this paper, we propose a novel Convolutional Neural Network (CNN) architecture for learning multi-scale feature representations with good tradeoffs between speed and accuracy. This is achieved by using a multi-branch network, which has different computational complexity at different branches. Through frequent merging of features from branches at distinct scales, our model obtains multi-scale features while using less computation. The proposed approach demonstrates improvement of model efficiency and performance on both object recognition and speech recognition tasks,using popular architectures including ResNet and ResNeXt. For object recognition, our approach reduces computation by 33% on object recognition while improving accuracy with 0.9%. Furthermore, our model surpasses state-of-the-art CNN acceleration approaches by a large margin in accuracy and FLOPs reduction. On the task of speech recognition, our proposed multi-scale CNNs save 30% FLOPs with slightly better word error rates, showing good generalization across domains. The codes are available at https://github.com/IBM/BigLittleNet

研究の動機と目的

  • マルチスケール特徴表現における速度と精度のバランスを取ることで、CNNの効率的な展開を動機づける。
  • 異なるスケールからの特徴を統合して表現を強化する、シンプルで汎用性のあるマルチブランチアーキテクチャを提案する。
  • 本手法が計算量を削減しつつオブジェクト認識の精度を向上させ、音声認識ではFLOPsを抑えつつWERを低下させることを示す。

提案手法

  • Big-Branch(高精度・高コスト)と Little-Branch(低コスト)からなる Big-Little Net (bL-Net) を、異なるスケールで動作させて導入する。
  • 各Big-Littleモジュール内で、変換後特徴の重み付き線形結合によりK本のブランチ(異なるスケール)を統合する。
  • 融合前にアップサンプリングと1×1畳み込みを用いてブランチ間の特徴マップを揃える。
  • Little-Branch の複雑さを二つのパラメータ alpha(幅)と beta(深さ)で制御し、FLOPsを削減する。
  • 統合後に残差ブロック(F(·))でブランチ出力を融合する。
  • ResNet、ResNeXt、SEResNeXt などのバックボーンと互換性があることを示し、同等または高い精度で約2倍の速度向上を達成する。
  • 線形結合による統合が、オブジェクト認識で連結よりも性能が良いことを示す。

実験結果

リサーチクエスチョン

  • RQ1マルチスケール・マルチブランチの融合は、単一スケールのベースラインよりも速度と精度のトレードオフを改善できるか。
  • RQ2Big-BranchとLittle-Branchはスケールを跨いでどのように相互作用し、情報を保持しつつ計算を削減するのか。
  • RQ3Little-Branch の複雑さパラメータ(alpha, beta)が、視覚・音声タスクの性能とFLOPsに与える影響は何か。
  • RQ4このアプローチはアーキテクチャ(ResNet、ResNeXt、SEResNeXt)およびモダリティ(視覚と音声)を超えて汎化できるか。

主な発見

  • ImageNet のオブジェクト認識では、bL-Net は複数のバックボーンで約1/3の計算量を削減し、精度を1ポイント超で改善、精度を落とさずFLOPsを最大で1/2削減できる可能性。
  • ResNet、ResNeXt、SEResNeXt のバックボーンにおいて、bL-Net は最大で約2倍の速度改善を達成し、ベースラインと比べてTop-1精度を維持または向上。
  • より深いモデルはbL-Netの恩恵を大きく受け、ResNet-152 ベースのバリアントは浅いものより大きな速度アップ(例: 2.3x)を示す。
  • 高解像度入力(例:256x256)で評価すると、bL-Net はFLOPs を抑えつつベースラインより精度を向上させる。
  • 音声認識では、bL-Net は約30%のFLOPs削減を実現し、WERがわずかに改善され、クロスドメインの汎化を示す。
  • ブランチの線形結合による統合は、物体認識と音声実験の双方で、連結より高い精度と正規化効果を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。