Skip to main content
QUICK REVIEW

[論文レビュー] TI-POOLING: transformation-invariant pooling for feature learning in Convolutional Neural Networks

Dmitry Laptev, Nikolay Savinov|arXiv (Cornell University)|Apr 21, 2016
Advanced Image and Video Retrieval Techniques参考文献 21被引用数 5
ひとこと要約

本稿では、回転やスケーリングなどの変換に対して不変な特徴抽出を可能にするTIプーリングと呼ばれる、畳み込みニューラルネットワークのための変換不変プーリング演算子を提案する。この手法は、入力画像の複数の変換版からの応答を集約するために、並列に接続されたシアンズブランチにおけるマックスプーリングを用いる。本手法は、データオーグメンテーションの冗長性と非効率性を回避し、単一で最適な「標準的」表現から学習することで、パラメータ数を減らし、収束を速める。ベンチマークデータセットにおいて最先端の性能を達成した。

ABSTRACT

In this paper we present a deep neural network topology that incorporates a simple to implement transformation invariant pooling operator (TI-POOLING). This operator is able to efficiently handle prior knowledge on nuisance variations in the data, such as rotation or scale changes. Most current methods usually make use of dataset augmentation to address this issue, but this requires larger number of model parameters and more training data, and results in significantly increased training time and larger chance of under- or overfitting. The main reason for these drawbacks is that the learned model needs to capture adequate features for all the possible transformations of the input. On the other hand, we formulate features in convolutional neural networks to be transformation-invariant. We achieve that using parallel siamese architectures for the considered transformation set and applying the TI-POOLING operator on their outputs before the fully-connected layers. We show that this topology internally finds the most optimal "canonical" instance of the input image for training and therefore limits the redundancy in learned features. This more efficient use of training data results in better performance on popular benchmark datasets with smaller number of parameters when comparing to standard convolutional neural networks with dataset augmentation and to other baselines.

研究の動機と目的

  • 深層学習における回転やスケーリングなどの不要な変化(ヌイズ要因)に対処するためのデータオーグメンテーションの非効率性と冗長性を解消すること。
  • データ変換(例:回転、スケーリング)に関する専門的知識をネットワークアーキテクチャに直接統合すること。
  • モデルの複雑さを増加させず、各変換ごとに別々に学習する必要もなく、変換不変特徴を生成するプーリング機構を開発すること。
  • すべての変換に対して一貫した「標準的」入力インスタンスから学習することで、一般化性能と学習効率を向上させること。

提案手法

  • 本手法は、重みを共有する並列なシアンズネットワークを用い、元の入力とその変換版(例:回転、スケーリング)を処理する。
  • TIプーリング演算子は、各特徴マップの位置において、すべての変換入力からの最大活性化を計算し、変換不変特徴を生成する。
  • プーリング操作により、最終的な特徴表現が入力の特定の変換に依存しなくなり、既知のヌイズ要因に対して不変性が達成される。
  • このアーキテクチャにより、バックプロパゲーションを用いて、共有畳み込み層とTIプーリング演算子を含む全ネットワークをエンドツーエンドで訓練できる。
  • 訓練中に、特徴の冗長性を低減するため、最も代表的な「標準的」入力インスタンスが暗黙的に同定される。
  • 本手法は標準的なCNNアーキテクチャと互換性があり、プラグイン層として簡単に統合可能である。

実験結果

リサーチクエスチョン

  • RQ1データオーグメンテーションに依存せずに、回転やスケーリングなどの既知の変換に対して不変な特徴を生成するプーリング機構を設計できるか?
  • RQ2共通の変換された入力表現から学習することで、標準的なデータオーグメンテーションと比較して、特徴学習の冗長性が低減するか?
  • RQ3TIプーリングは、データオーグメンテーションを用いた標準CNNと比較して、パラメータ数を減らし、収束を速めながらも、より高い性能を達成できるか?
  • RQ4複数インスタンス学習(MIL)と比較して、TIプーリングは変換不変タスクにおける性能と一般化能力で優れているか?

主な発見

  • 神経細胞セグメンテーションデータセットにおいて、ドロップアウトを用いたTIプーリングはピクセル誤差率7.0%を達成し、データオーグメンテーションを用いた標準CNN(8.1%)およびMIL(8.9%)を上回った。
  • 同等のデータ露出量(データオーグメンテーションCNNの384エポック vs. TIプーリングの16エポック)を考慮しても、TIプーリングモデルはパラメータ数を減らしながらも優れた性能を示した。
  • 本手法はベースラインと比較して収束速度が速く、学習データの効率的利用を示した。
  • TIプーリング演算子は、垂直方向や水平方向のエッジなどの特定の方向ごとの特徴検出器を別々に必要とせず、変換不変特徴を適切に学習した。
  • 理論的および実験的結果から、ネットワークが特徴学習の冗長性を低減するため、最も代表的な「標準的」入力インスタンスから学習していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。