Skip to main content
QUICK REVIEW

[論文レビュー] Digging Deep into the layers of CNNs: In Search of How CNNs Achieve View Invariance

Amr Bakry, Mohamed Elhoseiny|arXiv (Cornell University)|Aug 9, 2015
Advanced Neural Network Applications参考文献 23被引用数 13
ひとこと要約

本稿では、CNN特徴空間内のビュー多様体構造を定量化する手法を提案し、事前学習済みCNNがほとんどの層でビュー多様体幾何を保持していることが明らかになった。特にPool5層では、ビュー不変性を達成するために多様体を崩壊させるのではなく、分離することで達成されている。ポーズで微調整すると多様体構造が保持されるが、カテゴリで微調整すると最終層で多様体が直線に収縮することで不変性が向上し、DiCarlo & Coxの多様体解体仮説を支持するが、ポーズラベルなしで実行される。

ABSTRACT

This paper is focused on studying the view-manifold structure in the feature spaces implied by the different layers of Convolutional Neural Networks (CNN). There are several questions that this paper aims to answer: Does the learned CNN representation achieve viewpoint invariance? How does it achieve viewpoint invariance? Is it achieved by collapsing the view manifolds, or separating them while preserving them? At which layer is view invariance achieved? How can the structure of the view manifold at each layer of a deep convolutional neural network be quantified experimentally? How does fine-tuning of a pre-trained CNN on a multi-view dataset affect the representation at each layer of the network? In order to answer these questions we propose a methodology to quantify the deformation and degeneracy of view manifolds in CNN layers. We apply this methodology and report interesting results in this paper that answer the aforementioned questions.

研究の動機と目的

  • 深層CNNが学習した特徴表現でどのようにビュー不変性を達成するかを調査すること。
  • 不変性が多様体の収縮によって生じるのか、それとも多様体を保持・分離することで生じるのかを特定すること。
  • 実験的分析を用いて、CNNの各層におけるビュー多様体の構造的変化を定量化すること。
  • マルチビューデータセット上で事前学習済みCNNを微調整した際、各層における表現構造に与える影響を検討すること。
  • 事前学習済みCNNが多様体構造を通じて、見出し不変性とポーズ推定の両方を暗黙的にサポートしているかどうかを評価すること。

提案手法

  • 著者らは、条件数(rcond)や部分空間次元性といった線形代数的指標を用いて、CNN特徴空間内のビュー多様体の歪みと退化を定量化する手法を導入した。
  • 線形SVM、カーネル回帰、KNNを用いて、各層における線形分離可能性と多様体保持性を評価した。
  • RGBDおよびPascal3D+という2つのマルチビューデータセットを用いて、事前学習済みおよび微調整済みCNNに対して分析を実施した。
  • 本手法では、インスタンス固有のビュー多様体と各層におけるグローバルなオブジェクト・ビュー多様体構造の両方を評価した。
  • Pool5、FC6、FC8などの異なる層からの特徴活性化を用いて、微調整前後における多様体幾何の比較を行った。
  • 多様体部分空間の条件数を用いて、退化度と線形分離可能性を測定した。

実験結果

リサーチクエスチョン

  • RQ1学習済みCNN表現は見出し不変性を達成しているか? もしそうなら、どのように達成しているか?
  • RQ2見出し不変性は、ビュー多様体を収縮させることによって達成されているのか、それとも多様体を保持・分離することで達成されているのか?
  • RQ3事前学習済みCNNでは、どの層で見出し不変性が達成されているか?
  • RQ4深層CNNの各層におけるビュー多様体の構造を定量的に測定する方法は何か?
  • RQ5マルチビューデータセット上で事前学習済みCNNを微調整すると、各層における表現にどのような影響を与えるか?

主な発見

  • 事前学習済みCNNは、FC6やPool5を含むほとんどの層でビュー多様体構造を保持しており、マルチビュー学習を明示的に実施していないにもかかわらず、多様体幾何が維持されていることが示された。
  • Pool5層は、特に翻訳および回転不変性が向上しているため、Pool1などより前の層よりも、ビュー多様体構造の保持が顕著に優れていた。
  • 見出し不変性は多様体を収縮させることではなく、個々のインスタンス多様体を分離しながらも構造を保持することで達成されており、最終のFC8層を除いてはその傾向が見られた。
  • カテゴリ損失で微調整すると、FC8での線形分離性が向上し、ビュー多様体部分空間次元が1にまで低下し、多様体が直線に収縮することが示されたが、完全に退化したわけではない。
  • ポーズ損失で微調整すると、多様体構造がよりよく保持され、条件数(rcond)が向上し、仮説0(解体された多様体)に近づくように表現が変化した。
  • 驚くべきことに、カテゴリ微調整により、FC7、FC6、Pool5層でのポーズ推定性能がわずかに向上し、ポーズラベルが目的関数に含まれないにもかかわらず、初期層での見出し保存性が向上していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。