Skip to main content
QUICK REVIEW

[論文レビュー] XSepConv: Extremely Separated Convolution

Jiarong Chen, Zongqing Lu|arXiv (Cornell University)|Feb 27, 2020
Advanced Neural Network Applications参考文献 39被引用数 10
ひとこと要約

本稿では、空間的可分畳み込みと深度可分畳み込みを組み合わせることで、大キーホルの深度可分畳み込みにおけるFLOPsとパラメータ数を顕著に削減する、XSepConvと呼ばれる新しい畳み込みブロックを提案する。戦略的な$2\times2$深度可分畳み込みと改善された対称パディング方式を統合することにより、CIFAR-10、CIFAR-100、SVHN、Tiny-ImageNetにおいて、標準的な深度可分畳み込みよりも高い精度を達成しながら、優れた効率性を維持している。

ABSTRACT

Depthwise convolution has gradually become an indispensable operation for modern efficient neural networks and larger kernel sizes ($\ge5$) have been applied to it recently. In this paper, we propose a novel extremely separated convolutional block (XSepConv), which fuses spatially separable convolutions into depthwise convolution to further reduce both the computational cost and parameter size of large kernels. Furthermore, an extra $2 imes2$ depthwise convolution coupled with improved symmetric padding strategy is employed to compensate for the side effect brought by spatially separable convolutions. XSepConv is designed to be an efficient alternative to vanilla depthwise convolution with large kernel sizes. To verify this, we use XSepConv for the state-of-the-art architecture MobileNetV3-Small and carry out extensive experiments on four highly competitive benchmark datasets (CIFAR-10, CIFAR-100, SVHN and Tiny-ImageNet) to demonstrate that XSepConv can indeed strike a better trade-off between accuracy and efficiency.

研究の動機と目的

  • 効率的なCNNにおける大キーホル深度可分畳み込みの高い計算コストとパラメータコストを軽減すること。
  • チャネル別分離を超えた空間的分解を検討し、計算負荷をさらに低減すること。
  • 空間的可分畳み込みによる情報損失を補償するため、補償用の$2\times2$深度可分畳み込みを導入すること。
  • 深層ネットワークにおける偶数サイズ畳み込みの出力対称性とパフォーマンスを維持するため、対称パディングを改善すること。
  • モバイルおよびエッジAIモデル向けに、即座に統合可能な効率的な、オリジナルの深度可分畳み込みの代替手段を提供すること。

提案手法

  • XSepConvは、空間的可分畳み込み(幅方向および高さ方向)を深度可分畳み込みに統合し、大規模な2次元カーネルを1次元操作に分解する。
  • ブロックの開始部に追加の$2\times2$深度可分畳み込みを挿入し、可分畳み込みが見逃す方向性の情報を捉える。
  • 改善された対称パディング戦略は、単一の層ではなく、4つの連続する偶数サイズ畳み込み層にわたって対称パディングを適用することで、出力の非対称性を低減する。
  • 2段階のストライド畳み込み(s12およびs21)を用いて空間的ダウンサンプリングをサポートし、特徴の整合性を保つ。
  • アーキテクチャは、MobileNetV3-Smallなどのモデルにおける標準的な深度可分畳み込みの即座の置換として設計されている。
  • アブレーションスタディでは、$2\times2$畳み込みの配置とパディング戦略が精度と効率に与える影響が評価されている。

実験結果

リサーチクエスチョン

  • RQ1空間的可分畳み込みを深度可分畳み込みと効果的に組み合わせることで、大キーホル設定におけるFLOPsとパラメータ数を削減できるか?
  • RQ2空間的可分畳み込みによる情報損失を補償するため、$2\times2$深度可分畳み込みを追加することでパフォーマンスが向上するか?
  • RQ3提案された改善された対称パディング戦略は、元の方法と比較して最終ネットワークの精度にどのように影響するか?
  • RQ4XSepConvブロック内での$2\times2$深度可分畳み込みの最適な配置は、精度と効率の両面で最良のパフォーマンスを発揮するか?
  • RQ5XSepConvは、ベンチマークデータセット上で、計算コストを削減しながらも、標準的な深度可分畳み込みを上回る精度を達成できるか?

主な発見

  • XSepConvは、Tiny-ImageNetで1.70Mパラメータ、49.18M FLOPsでトップ1精度59.82%を達成し、ベースラインの深度可分畳み込みを上回っている。
  • CIFAR-100では、1.70Mパラメータ、49.18M FLOPsで74.02%の精度を達成し、元の対称パディングベースラインと比較して0.49%の向上を示している。
  • 空間的可分畳み込みの前段に$2\times2$畳み込みを配置したバージョン(XSepConv)が最良のパフォーマンスを示したが、後段に配置した場合(XSepConv-B)や並列に配置した場合(XSepConv-P)は、CIFAR-100でそれぞれ0.49%および0.88%の精度低下を示した。
  • 改善された対称パディング戦略は、元の対称パディング手法と比較して、CIFAR-100で0.21%、Tiny-ImageNetで0.24%の精度向上をもたらした。
  • XSepConvは、すべての4つのデータセット(CIFAR-10、CIFAR-100、SVHN、Tiny-ImageNet)で、ベースラインモデルと同等のFLOPsとパラメータ数を維持しながら、精度を向上させている。
  • アブレーションスタディの結果、$2\times2$深度可分畳み込みは、ブロックの先頭に配置された場合に最も効果的に機能し、空間的分解の前段で特徴表現を保持していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。