Skip to main content
QUICK REVIEW

[論文レビュー] Non-Parametric Transformation Networks

Dipan K. Pal, Marios Savvides|arXiv (Cornell University)|Jan 14, 2018
Graph Theory and Algorithms参考文献 34被引用数 3
ひとこと要約

この論文は、変換のパrametric形式を仮定せずに、データから一般化された不変性および対称性を直接学習する新しい深層畳み込みアーキテクチャである非パラメトリック変換ネットワーク(NPTN)を紹介する。NPTNは、パラメトリックに学習されたフィルタに対する変換プーリングを用いることで、ConvNetを一般化し、同じパラメータ数のもとでMNIST、CIFAR10、ETH-80で優れた性能を発揮するとともに、キャプセルネットワークの畳み込み層をNPTNモジュールに置き換えることで顕著に性能向上を実現する。

ABSTRACT

ConvNets, through their architecture, only enforce invariance to translation. In this paper, we introduce a new class of deep convolutional architectures called Non-Parametric Transformation Networks (NPTNs) which can learn extit{general} invariances and symmetries directly from data. NPTNs are a natural generalization of ConvNets and can be optimized directly using gradient descent. Unlike almost all previous works in deep architectures, they make no assumption regarding the structure of the invariances present in the data and in that aspect are flexible and powerful. We also model ConvNets and NPTNs under a unified framework called Transformation Networks (TN), which yields a better understanding of the connection between the two. We demonstrate the efficacy of NPTNs on data such as MNIST with extreme transformations and CIFAR10 where they outperform baselines, and further outperform several recent algorithms on ETH-80. They do so while having the same number of parameters. We also show that they are more effective than ConvNets in modelling symmetries and invariances from data, without the explicit knowledge of the added arbitrary nuisance transformations. Finally, we replace ConvNets with NPTNs within Capsule Networks and show that this enables Capsule Nets to perform even better.

研究の動機と目的

  • 変換のパラメトリックな形式を仮定せずに、データから一般化された不変性および対称性を学習できる深層学習アーキテクチャの開発。
  • 畳み込みニューラルネットワーク(ConvNet)の不変性メカニズムを、並進にとどまらず、データに観察された任意の変換へと拡張することで一般化すること。
  • 標準的な最適化手法(例:SGD)を用いたエンドツーエンド学習を可能にしつつ、計算効率およびメモリ効率を維持すること。
  • データ拡張や補助目的関数による不変性の強制ではなく、アーキテクチャそのものに不変性を直接モデル化することで、視覚ベンチマークにおける性能向上が達成されることを示すこと。
  • NPTNをキャプセルネットワークのような新興アーキテクチャに統合し、不変性学習および全体的な性能を向上させること。

提案手法

  • NPTNは、固定された重み共有を学習可能で非パラメトリックな変換に置き換えることで一般化された畳み込みニューラルネットワークの枠組みである変換ネットワーク(TN)に基づいている。
  • 各NPTNノードは、基本フィルタ $w$ から変換 $g$ を適用して得られる $|G|$ 個の変換フィルタ(テンプレート)を用いて畳み込み演算を実行する。
  • 出力は、入力パッチと各変換フィルタとのドット積によって計算され、$|G|$ 個のスカラー応答が得られる。
  • 変換プーリングは、$|G|$ チャネル(異なる変換を表す)に対して最大プーリングを適用することで、$G$ に符号化された変換に対して不変な出力を得る。
  • バックプロパゲーションと確率的勾配降下法(SGD)を用いた学習が行われ、訓練時および推論時において入力、活性化、フィルタの明示的変換は不要である。
  • 本手法は、パラメータ数を保ったまま、従来のアーキテクチャ(例:キャプセルネットワーク)に統合可能であり、標準的な畳み込み層をNPTN層に置き換えることで実現できる。

実験結果

リサーチクエスチョン

  • RQ1パラメトリックな形式を事前に仮定せず、データから任意の非パラメトリック変換に対する一般化された不変性を直接学習できる深層ニューラルネットワークアーキテクチャは存在するか?
  • RQ2MNISTやCIFAR10、ETH-80のような複雑な変換を伴うベンチマークにおいて、同じパラメータ数の制約のもとで、NPTNと標準的なConvNetの性能はどのように比較されるか?
  • RQ3NPTNをキャプセルネットワークのような最先端アーキテクチャの畳み込み部品に置き換えることで、どの程度性能が向上するか?
  • RQ4変換プーリングによるアーキテクチャ設計による不変性の学習は、データ拡張や補助損失に基づく不変性強制に比べて優れているか?
  • RQ5変換群の構造が未知または複雑な場合でも、NPTNは対称性および不変性を効果的にモデル化できるか?

主な発見

  • MNISTでは、極端な変換に対してNPTNは、チャンネル数を減らしたにもかかわらず、同じパラメータ数のもとで、より低いテスト誤差を達成し、従来のConvNetを上回った。
  • CIFAR10では、同じパラメータ予算のもとで、NPTNは自然画像データにおける不変性学習の向上を示し、ベースラインのConvNetよりも優れた一般化性能を発揮した。
  • ETH-80では、データ拡張や補助損失を用いた最近の最先端手法でさえも上回り、同じパラメータ数を維持したまま、NPTNが優れた性能を発揮した。
  • キャプセルネットワークの畳み込み層をNPTN層に置き換えた場合、テスト誤差は1.90%から0.78%に低下し、チャンネル数は1/3にまで削減された。これは顕著な性能向上を示している。
  • NPTNを用いたキャプセルネットワークにおける性能向上は、各キャプセル内で不変性をモデル化することで、全体の表現学習および物体認識能力が向上していることを示している。
  • NPTNは、変換群の構造を事前に知らなくても、データから直接複雑な非パラメトリックな対称性を効果的に学習できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。