Skip to main content
QUICK REVIEW

[論文レビュー] Deep Residual Axial Networks

Nazmul Shahadat, Anthony S. Maida|arXiv (Cornell University)|Jan 11, 2023
Advanced Neural Network Applications被引用数 7
ひとこと要約

本稿では、2次元畳み込みを高さおよび幅方向に連続して適用する1次元深度分離畳み込みに置き換え、勾配消失を軽減するための残差接続を組み合わせた、新しいCNNアーキテクチャ「残差軸ネットワーク(RANs)」を提案する。RANsは、ResNets、MobileNets、SqueezeNextsと比較して、パラメータ数を75–86%、FLOPsを67–80%削減しながら、CIFAR、SVHN、Tiny ImageNetベンチマークで最低1%の精度向上を達成する。

ABSTRACT

While convolutional neural networks (CNNs) demonstrate outstanding performance on computer vision tasks, their computational costs remain high. Several techniques are used to reduce these costs, like reducing channel count, and using separable and depthwise separable convolutions. This paper reduces computational costs by introducing a novel architecture, axial CNNs, which replaces spatial 2D convolution operations with two consecutive depthwise separable 1D operations. The axial CNNs are predicated on the assumption that the dataset supports approximately separable convolution operations with little or no loss of training accuracy. Deep axial separable CNNs still suffer from gradient problems when training deep networks. We modify the construction of axial separable CNNs with residual connections to improve the performance of deep axial architectures and introduce our final novel architecture namely residual axial networks (RANs). Extensive benchmark evaluation shows that RANs achieve at least 1% higher performance with about 77%, 86%, 75%, and 34% fewer parameters and about 75%, 80%, 67%, and 26% fewer flops than ResNets, wide ResNets, MobileNets, and SqueezeNexts on CIFAR benchmarks, SVHN, and Tiny ImageNet image classification datasets. Moreover, our proposed RANs improve deep recursive residual networks performance with 94% fewer parameters on the image super-resolution dataset.

研究の動機と目的

  • リソース制約のあるアプリケーションを想定し、精度を損なわずに深層CNNの計算コストを低減すること。
  • トレーニング中に勾配消失が生じるため、深層軸分離CNNで性能が低下する問題を解決すること。
  • 従来の2次元畳み込み層の代替として、パラメータ効率的かつ高性能な選択肢を提供すること。
  • ResNets、MobileNets、SqueezeNext、再帰的ネットワークを含む多様なアーキテクチャにおいて、軸方向1次元深度分離畳み込みの有効性を評価すること。
  • RANブロックが画像分類や画像超解像を含む複数のビジョンタスクに一般化可能であることを示すこと。

提案手法

  • 計算コストを低減するために、標準の2次元畳み込み演算を高さ方向および幅方向に連続して適用する1次元深度分離畳み込みに置き換える。
  • 深層ネットワークにおける勾配消失を緩和し、トレーニングを安定化させるために、軸方向分離ブロックに残差接続を適用する。
  • 標準の残差ブロックの代替としてRANブロックを構築し、ResNet、MobileNet、SqueezeNextなどの既存アーキテクチャへのドロップイン統合を可能にする。
  • 1次元軸畳み込みを用いて、1次元ずつ空間特徴を逐次処理することで、1チャネルあたりのFLOPsを$k^2$から$2k$に削減する。
  • 広いResNets、MobileNets、SqueezeNextsにRANブロックを統合し、RANベースの変種(例:WRANs、RAN-MobileNet、RAN-SqueezeNext)を構築する。
  • 画像超解像タスクにRANブロックを適用し、パラメータ数を削減しながらPSNRを向上させる、RANベースの再帰的ネットワーク(RARNet)を構築する。

実験結果

リサーチクエスチョン

  • RQ1軸方向1次元深度分離畳み込みは、計算コストを低減しつつ、精度を維持または向上させることができるか?
  • RQ2軸分離ブロックに残差接続を追加することで、深層アーキテクチャにおけるトレーニングの不安定性が効果的に緩和されるか?
  • RQ3RANベースのモデルは、標準のアーキテクチャ(例:ResNet、MobileNet、SqueezeNext)と比較して、パラメータ数、FLOPs、レイテンシ、精度の観点でどのように性能を発揮するか?
  • RQ4RANブロックは画像超解像のような分類タスク以外のタスクに対しても効果的に適用可能か?
  • RQ5RANsは、多様なデータセットおよびネットワークの深さにおいて、性能を損なわずにモデルサイズと推論コストをどの程度削減できるか?

主な発見

  • CIFAR-10、CIFAR-100、SVHN、Tiny ImageNetにおいて、RANsはResNets、ワイドResNets、MobileNets、SqueezeNextsと比較して、少なくとも1%高い検証精度を達成する。
  • CIFARベンチマークでは、RANsはResNets、MobileNets、SqueezeNextsと比較して、パラメータ数を75–86%、FLOPsを67–80%削減する。
  • 26層アーキテクチャにおいて、RANsはMobileNetと比較して、パラメータ数を75%、FLOPsを67%削減しながら、1%以上の精度向上を達成する。
  • RANベースのワイドResNets(WRANs)は、標準のワイドResNets(WRN)と比較して、86%もパラメータ数を削減し、すべてのワイドニング要因において精度が向上する。
  • Set5画像超解像データセットにおいて、RARNet(RANベースの再帰的ネットワーク)はDRRNと比較して、学習可能なパラメータ数を94%削減しながら、より高いPSNR値を達成する。
  • RANベースのSqueezeNextモデルは、23層アーキテクチャにおいて、元のSqueezeNextと比較して、パラメータ数を34%削減、FLOPsを24%削減、レイテンシを33%削減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。