Skip to main content
QUICK REVIEW

[論文レビュー] Active Convolution: Learning the Shape of Convolution for Image Classification

Yunho Jeon, Junmo Kim|arXiv (Cornell University)|Mar 27, 2017
Advanced Neural Network Applications参考文献 27被引用数 13
ひとこと要約

本稿では、受容 field の空間的形状と位置がバックプロパゲーションによって微分可能かつ最適化可能な、学習可能な畳み込み演算であるアクティブ畳み込みユニット(ACU)を提案する。分数型および可変型の受容 field を許容することで、アーキテクチャの変更なしに ImageNet で最大 0.79%、Place365 で最大 0.49% の画像分類精度向上を達成し、従来の畳み込みよりも優れた表現能力を示した。

ABSTRACT

In recent years, deep learning has achieved great success in many computer vision applications. Convolutional neural networks (CNNs) have lately emerged as a major approach to image classification. Most research on CNNs thus far has focused on developing architectures such as the Inception and residual networks. The convolution layer is the core of the CNN, but few studies have addressed the convolution unit itself. In this paper, we introduce a convolution unit called the active convolution unit (ACU). A new convolution has no fixed shape, because of which we can define any form of convolution. Its shape can be learned through backpropagation during training. Our proposed unit has a few advantages. First, the ACU is a generalization of convolution; it can define not only all conventional convolutions, but also convolutions with fractional pixel coordinates. We can freely change the shape of the convolution, which provides greater freedom to form CNN structures. Second, the shape of the convolution is learned while training and there is no need to tune it by hand. Third, the ACU can learn better than a conventional unit, where we obtained the improvement simply by changing the conventional convolution to an ACU. We tested our proposed method on plain and residual networks, and the results showed significant improvement using our method on various datasets and architectures in comparison with the baseline.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)における固定形状の畳み込みカーネルの硬直性を緩和し、表現の柔軟性を向上させること。
  • 微分可能な位置パラメータを用いて、分数型やグリッド外の位置を含む畳み込みカーネル形状のエンドツーエンド学習を可能にすること。
  • 標準的な畳み込みをACUに置き換えることで、アーキテクチャの変更なしに画像分類性能を向上させること。
  • 学習可能な受容 field が、シンプルネットワークおよび残差ネットワークの両方における特徴表現を向上させることかどうかを調査すること。

提案手法

  • ACUは、各カーネル要素に対して学習可能な位置パラメータを導入し、トレーニング中に受容 field を空間的に変形可能にする。
  • 隣接するニューロン間の双線形補間を用いて出力を計算することで、ニューロン間の空間にも接続を可能にする。
  • 位置パラメータはバックプロパゲーションにより更新され、ネットワークがエンドツーエンドで最適なカーネル形状を学習可能になる。
  • ACUは標準畳み込みを一般化でき、拡張、分数型、不規則形状のカーネルを表現可能である。
  • 初期段階では位置パラメータを固定するウォームアップフェーズを実施し、トレーニングの安定化を図る。
  • ACUは、$3\times3$ 畳み込みを置き換えることで、AlexNet や ResNet などの標準CNNに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1学習可能で可変可能な畳み込みカーネル形状は、画像分類性能の向上に寄与するか?
  • RQ2ACUは、シンプルネットワークおよび残差ネットワークの両方で、標準畳み込みを上回る性能を示すか?
  • RQ3ネットワークの深さやデータセットの複雑さに応じて、学習された受容 field 形状はどのように異なるか?
  • RQ4ACUは、アーキテクチャの再設計なしに、複数のデータセットやアーキテクチャに一般化可能か?

主な発見

  • AlexNet の $3\times3$ 畳み込みをACUに置き換えたところ、Place365 の検証セットでトップ-1精度が 0.6% 向上し、トップ-5精度が 0.79% 向上した。
  • 26層の残差ネットワークでは、ACUを用いることでトップ-5精度が 0.49% 向上し、追加パラメータはたった 128 個にとどまった。
  • ACUは、グリッド外で不規則な受容 field パatters(複数の受容 field の組み合わせなど)を学習し、特に深い層で顕著であった。
  • ウォームアップフェーズを経過した後、ACUネットワークではテスト誤差が顕著に低下し、形状学習の有効性が示された。
  • 深い層では、特に Place365 データセットの大きな画像に対して、学習されたACU形状がより複雑で大きい傾向にあった。
  • ACUは、複数のデータセットおよびネットワークアーキテクチャにわたり一貫した性能向上を達成し、一般化性と頑健性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。