Skip to main content
QUICK REVIEW

[論文レビュー] Structured Convolutions for Efficient Neural Network Design

Yash Bhalgat, Yizhe Zhang|arXiv (Cornell University)|Aug 6, 2020
Advanced Neural Network Applications参考文献 47被引用数 8
ひとこと要約

本稿では、標準的な畳み込みカーネルを和集合プーリング演算と、より小さな低複雑性の畳み込みに分解する手法、構造的畳み込み(Structured Convolutions)を提案する。構造的正則化損失を導入することで、標準的なネットワークがこの効率的な構造を学習可能となり、精度の低下を最小限に抑えつつ、ResNetでは最大2倍小さく、HRNetでは50%小さくモデル圧縮を実現。既存のテンソル分解やプルーニング手法に比べ、効率性において優れている。

ABSTRACT

In this work, we tackle model efficiency by exploiting redundancy in the extit{implicit structure} of the building blocks of convolutional neural networks. We start our analysis by introducing a general definition of Composite Kernel structures that enable the execution of convolution operations in the form of efficient, scaled, sum-pooling components. As its special case, we propose extit{Structured Convolutions} and show that these allow decomposition of the convolution operation into a sum-pooling operation followed by a convolution with significantly lower complexity and fewer weights. We show how this decomposition can be applied to 2D and 3D kernels as well as the fully-connected layers. Furthermore, we present a Structural Regularization loss that promotes neural network layers to leverage on this desired structure in a way that, after training, they can be decomposed with negligible performance loss. By applying our method to a wide range of CNN architectures, we demonstrate "structured" versions of the ResNets that are up to 2$ imes$ smaller and a new Structured-MobileNetV2 that is more efficient while staying within an accuracy loss of 1% on ImageNet and CIFAR-10 datasets. We also show similar structured versions of EfficientNet on ImageNet and HRNet architecture for semantic segmentation on the Cityscapes dataset. Our method performs equally well or superior in terms of the complexity reduction in comparison to the existing tensor decomposition and channel pruning methods.

研究の動機と目的

  • リソース制約のあるデバイスへのディープニューラルネットワークの統合を容易にするために、畳み込みカーネル内に潜む構造的冗長性を活用すること。
  • 精度の著しい低下を伴わずに、モデルの複雑さとパラメータ数を削減すること。
  • 標準的な畳み込み層が、和集合プーリングと軽量畳み込みへの効率的分解が可能な構造的形に学習するのを促すトレーニング手法を開発すること。
  • ハードウェアにやさしい演算を活用し、和集合プーリングと軽量畳み込みによる効率的な推論を可能にすること。

提案手法

  • M個の線形独立なバイナリマスクを重ね合わせることで畳み込みカーネルを構成する一般化フレームワークとして、複合カーネル(Composite Kernels)を導入。
  • 複合カーネルの特別なケースとして、和集合プーリング層とc × n × nのカーネルを持つ小さな畳み込みに分解可能な構造的畳み込み(Structured Convolutions)を提案。これにより、元のC × N × Nのカーネルから、より小さなカーネルに置き換えられる。
  • 重み行列を構造的部分空間に射影する際のフロベニウスノルムの誤差を最小化する構造的正則化損失を設計。トレーニング中に望ましいカーネル構造の促進を実現。
  • 2次元および3次元畳み込み、および全結合層に対してもこの分解を適用。多様なアーキテクチャへの適合性を確保。
  • 2段階のプロセスを採用:まずフルカーネルと正則化を用いてトレーニングし、その後推論時に各カーネルを和集合プーリング+小さな畳み込みに置き換える。
  • 正則化に基づくトレーニングアプローチが、構造的制約を段階的に導入するため、直接的に分解されたアーキテクチャでトレーニングするのと比較して、精度が0.9%〜1.5%高いことを実証。

実験結果

リサーチクエスチョン

  • RQ1畳み込みカーネル重みに隠れた構造的冗長性を活用することで、精度の著しい低下を伴わずモデルの複雑さを低減できるか?
  • RQ2標準的な畳み込み層を、和集合プーリングと軽量畳み込みへの効率的分解が可能な構造的形に学習させるにはどうすればよいか?
  • RQ3構造的正則化損失は、直接的に分解されたアーキテクチャでトレーニングするのと比較して、モデルの精度と効率にどのような影響を与えるか?
  • RQ4ResNet、MobileNetV2、EfficientNet、HRNetといった多様なアーキテクチャにおいて、構造的畳み込みはモデルサイズとFLOPsをどの程度削減できるか?
  • RQ5既存のテンソル分解およびチャネルプルーニング技術と比較して、本手法は効率性と精度の面で優れているか?

主な発見

  • 構造的ResNetは、ImageNetおよびCIFAR-10で標準ResNetと比較して最大2倍小さく、精度の低下はほとんどない。
  • 提案された構造的MobileNetV2は、MobileNetV2よりも高い効率性を達成し、ImageNetおよびCIFAR-10で精度低下がわずか1%にとどまる。
  • ImageNet上での構造的EfficientNetは、モデルサイズと計算量を削減しながら、精度の低下は最小限に抑えられる。
  • Cityscapesで評価されたHRNetベースのセマンティックセグメンテーションモデルは、サイズが50%小さく、FLOPsは30%削減され、mIoUは1.5%の低下にとどまる。
  • 構造的正則化損失は、大規模バッチサイズであってもトレーニング時間およびメモリ使用量に5%未満のオーバーヘッドしか追加しない。実用的である。
  • 正則化に基づくトレーニング手法は、直接的に分解されたアーキテクチャでトレーニングするのと比較して、精度が0.9%〜1.5%高い。これは、段階的な構造的制約学習によるものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。