Skip to main content
QUICK REVIEW

[論文レビュー] Cascaded Subpatch Networks for Effective CNNs

Xiaoheng Jiang, Yanwei Pang|arXiv (Cornell University)|Mar 1, 2016
Advanced Neural Network Applications参考文献 38被引用数 5
ひとこと要約

本論文は、標準の畳み込みフィルタを、h×wの線形フィルタに続く1×1フィルタから構成される段階的なサブパッチフィルタに置き換えることで、局所的な画像パッチからより豊かでより頑健な特徴を抽出する、新しいCNNアーキテクチャであるCascaded Subpatch Networks(CSNet)を提案する。空間次元が1つのニューロンにまで減少するまでこのような層を積み重ねることで、コンactなアーキテクチャで最先端の性能を達成し、モデルアンサンブルを用いない状態でCIFAR-10で5.68%のテスト誤差を達成した。

ABSTRACT

Conventional Convolutional Neural Networks (CNNs) use either a linear or non-linear filter to extract features from an image patch (region) of spatial size $ H imes W $ (Typically, $ H $ is small and is equal to $ W$, e.g., $ H $ is 5 or 7). Generally, the size of the filter is equal to the size $ H imes W $ of the input patch. We argue that the representation ability of equal-size strategy is not strong enough. To overcome the drawback, we propose to use subpatch filter whose spatial size $ h imes w $ is smaller than $ H imes W $. The proposed subpatch filter consists of two subsequent filters. The first one is a linear filter of spatial size $ h imes w $ and is aimed at extracting features from spatial domain. The second one is of spatial size $ 1 imes 1 $ and is used for strengthening the connection between different input feature channels and for reducing the number of parameters. The subpatch filter convolves with the input patch and the resulting network is called a subpatch network. Taking the output of one subpatch network as input, we further repeat constructing subpatch networks until the output contains only one neuron in spatial domain. These subpatch networks form a new network called Cascaded Subpatch Network (CSNet). The feature layer generated by CSNet is called csconv layer. For the whole input image, we construct a deep neural network by stacking a sequence of csconv layers. Experimental results on four benchmark datasets demonstrate the effectiveness and compactness of the proposed CSNet. For example, our CSNet reaches a test error of $ 5.68\% $ on the CIFAR10 dataset without model averaging. To the best of our knowledge, this is the best result ever obtained on the CIFAR10 dataset.

研究の動機と目的

  • 入力パッチサイズと一致するフィルタを使用する従来のCNNの表現能力の限界を是正すること。
  • ネットワークの深さや幅を著しく増加させることなく、局所的な画像パッチにおける特徴抽象化を向上させること。
  • 階層的なサブパッチ特徴学習を通じて、モデルの複雑さを低減しつつ識別力を強化すること。
  • 標準ベンチマークでのパフォーマンス向上を図る、コンactなが高効率な畳み込み層構造を開発すること。

提案手法

  • 標準のH×W畳み込みフィルタを、h>1、w>1であるh×wのサブパッチフィルタに続く1×1フィルタに置き換える。
  • 最初のサブパッチフィルタを用いて、入力パッチの部分領域からの空間的特徴を抽出する。
  • 最初のフィルタの後に1×1畳み込みフィルタを適用し、チャネル間の情報を統合し、パrameter数を削減する。
  • 複数のサブパッチネットワークを逐次的にスタックし、各特徴マップあたり1つのニューロンが残るまで空間次元を縮小する。
  • 単一の段階的なサブパッチネットワークの出力をcsconv層として構築し、これにより標準の畳み込み層を置き換える。
  • 端末から端末まで学習可能なエンドツーエンドの深層ネットワークを構築するために、複数のcsconv層をネットワークアーキテクチャ全体にスタックする。

実験結果

リサーチクエスチョン

  • RQ1固定サイズのフィルタと比較して、階層的なサブパッチフィルタリング機構はCNNにおける特徴表現を改善できるか?
  • RQ2空間サイズを小さくしたサブパッチフィルタを1×1フィルタで統合することで、パrameter数を減らしつつ一般化性能が向上するか?
  • RQ3データオーグメンテーションを用いずに、このアーキテクチャが標準的なビジョンベンチマークで最先端のパフォーマンスを達成できるか?
  • RQ4CIFARおよびMNISTデータセットにおいて、提案されたcsconv層は、既存の深層ネットワークと比較して効率性と正確性の面で優れているか?

主な発見

  • CSNetは、モデルアンサンブルを用いない状態で、CIFAR-10で5.68%のテスト誤差を達成し、本論文発表時におけるこのデータセットで報告された最高の結果である。
  • CIFAR-100では、CSNet-Mが30.24%のテスト誤差を達成し、2番目に良い手法(RCNN-160:31.75%)を1.51ポイント上回った。
  • MNISTでは、CSNet-Sが0.31%のテスト誤差を達成し、最高パフォーマンスを示した手法と同等の結果を出し、最先端の性能を達成した。
  • SVHNでは、CSNet-Mが1.90%のテスト誤差を達成し、最高結果(1.80%)に非常に近づき、NINを0.45ポイント上回った。
  • 提案されたcsconv層はパrameter数を削減しながら特徴抽象化を向上させ、コンactでありながら強力なネットワークを可能にした。
  • 段階的なサブパッチ設計により、H×Wから1×1に減少する解像度のピラミッドに類似した階層的特徴学習が効果的に実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。