Skip to main content
QUICK REVIEW

[論文レビュー] MUXConv: Information Multiplexing in Convolutional Neural Networks

Zhichao Lu, Kalyanmoy Deb|arXiv (Cornell University)|Mar 31, 2020
Advanced Neural Network Applications参考文献 51被引用数 5
ひとこと要約

MUXConvは、空間的およびチャネル的次元における情報の流れを空間的およびチャネル的多重化によって向上させる、新しい畳み込み層を導入する。これにより、効率的でコン act かつ正確なモデルが実現される。MUXNetsは、MUXConvを基盤とし、多目的の進化的アルゴリズムを用いて探索されたもので、ImageNetでMobileNetV3と同等の精度(top-1 75.3%)とFLOPs(218M)を達成しながら、1.6倍コンパクトであり、ImageNet、ChestX-Ray14、PASCAL VOC 2007の複数のベンチマークで、精度、効率性、コンパクト性の観点から他のモバイルモデルを上回る性能を示す。

ABSTRACT

Convolutional neural networks have witnessed remarkable improvements in computational efficiency in recent years. A key driving force has been the idea of trading-off model expressivity and efficiency through a combination of $1 imes 1$ and depth-wise separable convolutions in lieu of a standard convolutional layer. The price of the efficiency, however, is the sub-optimal flow of information across space and channels in the network. To overcome this limitation, we present MUXConv, a layer that is designed to increase the flow of information by progressively multiplexing channel and spatial information in the network, while mitigating computational complexity. Furthermore, to demonstrate the effectiveness of MUXConv, we integrate it within an efficient multi-objective evolutionary algorithm to search for the optimal model hyper-parameters while simultaneously optimizing accuracy, compactness, and computational efficiency. On ImageNet, the resulting models, dubbed MUXNets, match the performance (75.3% top-1 accuracy) and multiply-add operations (218M) of MobileNetV3 while being 1.6$ imes$ more compact, and outperform other mobile models in all the three criteria. MUXNet also performs well under transfer learning and when adapted to object detection. On the ChestX-Ray 14 benchmark, its accuracy is comparable to the state-of-the-art while being $3.3 imes$ more compact and $14 imes$ more efficient. Similarly, detection on PASCAL VOC 2007 is 1.2% more accurate, 28% faster and 6% more compact compared to MobileNetV2. Code is available from https://github.com/human-analysis/MUXConv

研究の動機と目的

  • 深い分離畳み込みおよび1×1畳み込みにおける最適でない情報の流れ、特に空間的およびチャネル的相互作用の分離を是正すること。
  • 計算コストを増加させずに、クロスチャネルおよび空間的特徴の相互作用を回復・強化する計算効率の良い畳み込み層の設計。
  • 精度、モデルのコンパクト性、計算効率を同時に最適化する多目的ニューラルアーキテクチャ探索(NAS)フレームワークの開発。
  • 画像分類、物体検出、セマンティックセグメンテーション、および転移学習タスクの複数のベンチマーク(ImageNet、ChestX-Ray14、PASCAL VOC 2007、ADE20K)におけるMUXNetsの評価。
  • モバイルCNN設計において、コンパクト性を犠牲にすることなく、効率性と精度を両立できるかの実証。

提案手法

  • MUXConvは、空間シャッフルとアンシャッフルを用いた空間的多重化により、深度分離またはグループ畳み込みを適用する前にマルチスケール特徴を抽出する。
  • チャネル多重化は、ShuffleNetにインspiredされたチャネルシャッフル機構を用い、チャネル間の情報伝達を可能にし、深度分離畳み込みの限界を克服する。
  • 学習可能なシャッフル操作を深度分離/グループ畳み込みと統合することで、計算効率を維持しつつ表現力の向上を実現する。
  • 精度、FLOPs、モデルサイズを同時に最適化する目的で、最適なMUXConvハイパーパramータ(グループ要因Gおよびリーブアウト比L)を探索するため、集団ベースの多目的進化的アルゴリズムを用いる。
  • 多目的問題を単一目的のサブ問題に分解し、協調的に解くことで、探索の効率性と収束性を向上させる。
  • 得られたMUXNetsは、画像分類、物体検出、セマンティックセグメンテーション、および転移学習タスクの複数のベンチマークで評価される。

実験結果

リサーチクエスチョン

  • RQ1計算コストを増加させることなく、空間的およびチャネル的次元における情報の流れを向上させられる畳み込み層を設計可能か?
  • RQ2既存のアーキテクチャと比較して顕著に小型化されたモデルサイズを維持しつつ、モバイルCNNで最先端の精度と効率性を達成可能か?
  • RQ3多目的NASフレームワークは、モバイルモデル設計における精度、コンパクト性、計算効率のバランスを効果的にとれるか?
  • RQ4分布シフトおよびモデルのロバストネス評価において、MUXNetは先行するモバイルモデルと比較してどのように性能を発揮するか?
  • RQ5MUXNetsは、転移学習およびセマンティックセグメンテーションのような密度予測タスクにどの程度一般化可能か?

主な発見

  • ImageNetでは、MUXNetはtop-1精度75.3%、FLOPs 218Mを達成し、MobileNetV3と同等の性能を示すが、モデルサイズは1.6倍小さくなった。
  • ChestX-Ray14では、最先端の精度を達成しながら、先行モデルと比較して3.3倍コンパクトで、14倍計算効率が向上した。
  • PASCAL VOC 2007の物体検出タスクでは、MUXNetはMobileNetV2と比較して1.2%高い精度、28%速く、6%コンパクトだった。
  • ADE20Kにおけるセマンティックセグメンテーションでは、MUXNet-mにPPMヘッドを適用した場合、mIoUは35.80%、FLOPsは0.2Bで、効率性においてMobileNetV2を上回りながらも、競争力のある精度を維持した。
  • ImageNet-V2およびImageNet-Cでは、MUXNet-mは強い汎化性能とロバストネスを示し、分布シフトやノイズの影響に対しても競争力ある性能を維持した。
  • 定性的な分析により、MUXNet-mはChestX-Ray14で判別力があり、クラスに特化した活性化マップを学習していることが確認され、正解領域と整合性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。