Skip to main content
QUICK REVIEW

[論文レビュー] PydMobileNet: Improved Version of MobileNets with Pyramid Depthwise Separable Convolution

Van-Thanh Hoang, Kang-Hyun Jo|arXiv (Cornell University)|Nov 17, 2018
IoT and Edge/Fog Computing参考文献 45被引用数 4
ひとこと要約

本論文では、空間的特徴をより豊かに捉えるために、標準の3×3深度可分畳み込みをピラミッドカーネルサイズ戦略に置き換えた改良型MobileNet、PydMobileNetを提案する。特徴マップを加算または連結することで統合し、幅乗数を調整することにより、CIFAR-10およびCIFAR-100において、MobileNetや他の最先端モデルと比較してパラメータ数が少なく、遅延のトレードオフが優れている。

ABSTRACT

Convolutional neural networks (CNNs) have shown remarkable performance in various computer vision tasks in recent years. However, the increasing model size has raised challenges in adopting them in real-time applications as well as mobile and embedded vision applications. Many works try to build networks as small as possible while still have acceptable performance. The state-of-the-art architecture is MobileNets. They use Depthwise Separable Convolution (DWConvolution) in place of standard Convolution to reduce the size of networks. This paper describes an improved version of MobileNet, called Pyramid Mobile Network. Instead of using just a $3 imes 3$ kernel size for DWConvolution like in MobileNet, the proposed network uses a pyramid kernel size to capture more spatial information. The proposed architecture is evaluated on two highly competitive object recognition benchmark datasets (CIFAR-10, CIFAR-100). The experiments demonstrate that the proposed network achieves better performance compared with MobileNet as well as other state-of-the-art networks. Additionally, it is more flexible in fine-tuning the trade-off between accuracy, latency and model size than MobileNets.

研究の動機と目的

  • 計算リソースが限られたモバイルおよび組み込みデバイスに、コンactで正確なCNNをデプロイする課題に対処すること。
  • MobileNetが固定された3×3深度可分畳み込みに依存しているのを改善し、マルチスケールの空間的特徴抽出を可能にすること。
  • 調整可能なネットワーク幅と特徴統合戦略を通じて、モデルの精度、推論遅延、パラメータ数のバランスを高める柔軟性を提供すること。
  • ピラミッドカーネルサイズ深度可分畳み込みが、ベンチマークデータセットにおいて、精度と効率の両面で標準の深度可分畳み込みを上回ることを実証すること。

提案手法

  • MobileNetの標準的な3×3深度可分畳み込みを、複数のカーネルサイズ(例:3×3、5×5、7×7)を並列に適用するピラミッドカーネルサイズ戦略に置き換える。
  • チャネル次元を制御し、計算効率を維持するためにボトルネック残差ブロックを用いる。
  • 異なるカーネルサイズからの特徴マップを要素ごとの加算または連結によって統合し、空間的およびチャネルワイズの情報を保持する。
  • 幅乗数ハイパーパrameterを導入してチャネル数をスケーリングし、モデル容量を制御することで、精度、サイズ、遅延の間の微細なトレードオフを可能にする。
  • 標準的な最適化プロトコルに従い、CIFAR-10およびCIFAR-100データセット上でネットワークをエンドツーエンドで訓練する。
  • CPUおよびGPUでの推論速度を評価し、特にディープラーニングフレームワークにおける深度可分畳み込み実装のプラットフォーム固有の非効率性を考慮した、実際のデプロイ可能性を検証する。

実験結果

リサーチクエスチョン

  • RQ1MobileNetにおける固定された3×3カーネルと比較して、深度可分畳み込みにピラミッドカーネルサイズ戦略を適用することで、特徴表現が向上するか?
  • RQ2加算または連結による特徴統合の選択が、モデルの精度、パラメータ数、推論速度に与える影響は何か?
  • RQ3PydMobileNetは、CIFAR-10およびCIFAR-100において、MobileNetや他の最先端モデルと比較して、より少ないパラメータでより高い精度を達成できるか?
  • RQ4現在のディープラーニングフレームワークにおける深度可分畳み込み実装の非効率性を考慮しても、CPUおよびGPUにデプロイされた際のPydMobileNetの推論速度は、MobileNetやResNetと比較してどうか?

主な発見

  • PydMobileNet-Add-56-1は、CIFAR-100でトップ1誤差率10.7%を達成し、パラメータ数は0.382Mにとどまり、MobileNet-56-1(0.416Mパラメータ、11.1%誤差)や他の最先端モデルを上回った。
  • CIFAR-10では、PydMobileNetのバリエーションが、MobileNetやResNetと同等または低い誤差率を達成したが、パラメータ数は著しく少なかった。
  • PydMobileNet-Concat-56-0.25は、CIFAR-100でトップ1誤差率17.7%を達成し、パラメータ数はわずか0.175Mにとどまり、非常に高い効率性を示した。
  • 推論速度の評価では、PydMobileNet-ConcatバリエーションがCPUおよびGPUの両方でMobileNetと同等の速度を達成しており、より深いアーキテクチャであるにもかかわらず、実用的なデプロイ可能性を示唆した。
  • 幅乗数や統合戦略の異なるバリエーションにおいても、モデルの性能は安定しており、精度・遅延・サイズのトレードオフを微調整する柔軟性があることが確認された。
  • 訓練曲線では、56層のPydMobileNet-0.25-Concatが、110層のResNetと同等のテスト誤差を達成したが、パラメータ数は著しく少なく、収束速度も速かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。