Skip to main content
QUICK REVIEW

[論文レビュー] ANTNets: Mobile Convolutional Neural Networks for Resource Efficient Image Classification

Yunyang Xiong, Hyunwoo J. Kim|arXiv (Cornell University)|Apr 7, 2019
Advanced Neural Network Applications参考文献 25被引用数 18
ひとこと要約

ANTNetは、効率的なチャネルワイズアテンションとグループ化畳み込みを用いて、深度分離畳み込み層と投影層間のチャネル相互依存関係をモデル化することで、表現力の向上を図る、モバイルデバイスに最適化された新しい畳み込みニューラルネットワークブロックであるANTBlockを提案する。この手法は、モバイルデバイス上で20%高速な推論を達成し、ImageNet上でのトップ1正解率をMobileNetV2より0.8%向上させる。iPhone 5sでの推論遅延は157.7msである。

ABSTRACT

Deep convolutional neural networks have achieved remarkable success in computer vision. However, deep neural networks require large computing resources to achieve high performance. Although depthwise separable convolution can be an efficient module to approximate a standard convolution, it often leads to reduced representational power of networks. In this paper, under budget constraints such as computational cost (MAdds) and the parameter count, we propose a novel basic architectural block, ANTBlock. It boosts the representational power by modeling, in a high dimensional space, interdependency of channels between a depthwise convolution layer and a projection layer in the ANTBlocks. Our experiments show that ANTNet built by a sequence of ANTBlocks, consistently outperforms state-of-the-art low-cost mobile convolutional neural networks across multiple datasets. On CIFAR100, our model achieves 75.7% top-1 accuracy, which is 1.5% higher than MobileNetV2 with 8.3% fewer parameters and 19.6% less computational cost. On ImageNet, our model achieves 72.8% top-1 accuracy, which is 0.8% improvement, with 157.7ms (20% faster) on iPhone 5s over MobileNetV2.

研究の動機と目的

  • 厳密な計算リソースとパラメータ制約下での、軽量でリソース効率の良いCNNブロックの設計。
  • 計算コストを増加させることなく、深度分離畳み込みの表現力を向上させること。
  • 深度分離畳み込み層と投影層間のチャネル間相互依存関係を、効率的なアテンション機構を用いてモデル化すること。
  • 実際のモバイルハードウェア上で、MobileNetV2 や NASNet-A などの既存のモバイルネットワークを上回る、より高速な推論と高い正解率を達成すること。
  • わずかなオーバーヘッドで済ませ、即挿入可能でフレームワーク互換性を持つブロックを提供すること。

提案手法

  • 深度分離畳み込み、グループ化ポイントワイズ畳み込み、および新規のチャネルワイズアテンション機構を統合した新しい基本アーキテクチャユニットであるANTBlockを提案する。
  • 深度分離畳み込み層と投影層からの特徴量の間の相互依存関係を、高次元空間でモデル化する動的チャネル再重み付け機構を導入する。
  • パラメータ数と計算コストを削減しながらも、表現力の保持を図るためにグループ化畳み込みを活用する。
  • 2段階のアテンション機構を採用:グローバル平均プーリングの後に全結合層を用いてチャネル重みを計算し、特徴量の選択的再重み付けを可能にする。
  • 既存のディープラーニングフレームワークと互換性を持たせ、モバイルネットワークアーキテクチャへの容易な統合を可能にする。
  • チャネル受容 field を最大化し、完全なチャネル情報のフローを維持するようにブロック構成を最適化する。

実験結果

リサーチクエスチョン

  • RQ1チャネルワイズアテンションを深度分離畳み込みに効果的に適用することで、計算コストを増加させずに表現力を向上させることができるか?
  • RQ2モバイルフレンドリーなアーキテクチャにおいて、深度分離畳み込みとポイントワイズ畳み込みの特徴量間の相互依存関係を効率的にモデル化できるか?
  • RQ3グループ化畳み込みとアテンション機構を組み合わせることで、パラメータ数とFLOPsを削減しながら、精度を維持または向上させられるか?
  • RQ4提案されたANTBlockは、最先端の軽量モデルと比較して、実際のモバイルハードウェア上での推論速度と正解率を向上させることができるか?
  • RQ5ANTBlockは、MAddsとパラメータ数の厳密な制約下でも、効率的で高性能なモバイルネットワークを構築するために一般化可能か?

主な発見

  • CIFAR-100ではANTNetが75.7%のトップ1正解率を達成し、MobileNetV2より1.5%高い。パラメータ数は8.3%少なく、計算コストは19.6%低い。
  • ImageNetではANTNetが72.8%のトップ1正解率を達成し、MobileNetV2より0.8%高い。iPhone 5sでの推論遅延は157.7msで、MobileNetV2より20%高速である。
  • 深さ倍率α=1.4のANTNetは75.0%のトップ1正解率を達成し、MobileNetV2より0.3%、NASNet-Aより1%、DARTSより2%高い。
  • g=2グループのモデルでは267M MAddsと13.4MBのCoreMLサイズを達成し、MobileNetV2と比較してFLOPsとモデルサイズの両方を削減した。
  • iPhone 5sでの推論速度はMobileNetV2より20%高速であり、デスクトップCPU上でも一貫して8-10%の高速化が確認された。
  • ANTBlockの設計は実装が簡単で、主要なディープラーニングフレームワークと互換性があり、モバイルデバイスへの容易なデプロイが可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。