Skip to main content
QUICK REVIEW

[論文レビュー] SwiDeN : Convolutional Neural Networks For Depiction Invariant Object Recognition

Ravi Kiran Sarvadevabhatla, Shiv Surya|arXiv (Cornell University)|Jul 29, 2016
Advanced Neural Network Applications参考文献 15被引用数 4
ひとこと要約

SwiDeN は、写真とアート的ドローイングの両方のスタイル固有サブネットワーク間で深く動的に入れ替えるメカニズムを採用することで、表現スタイルに依存しないオブジェクト認識を達成する、新しい畳み込みニューラルネットワークアーキテクチャである。ベースラインおよびドメイン適応手法を上回り、Photo-Art-50 データセットで全体の正確度が 94.42% を達成した。特に非写真的「アート」表現では 91.12% の正確度を示し、クロス表現認識分野における最先端の性能を実証した。

ABSTRACT

Current state of the art object recognition architectures achieve impressive performance but are typically specialized for a single depictive style (e.g. photos only, sketches only). In this paper, we present SwiDeN : our Convolutional Neural Network (CNN) architecture which recognizes objects regardless of how they are visually depicted (line drawing, realistic shaded drawing, photograph etc.). In SwiDeN, we utilize a novel `deep' depictive style-based switching mechanism which appropriately addresses the depiction-specific and depiction-invariant aspects of the problem. We compare SwiDeN with alternative architectures and prior work on a 50-category Photo-Art dataset containing objects depicted in multiple styles. Experimental results show that SwiDeN outperforms other approaches for the depiction-invariant object recognition problem.

研究の動機と目的

  • 現在のモデルが単一のスタイルに特化していることから、写真やスケッチ、ドローイングなどの多様な表現スタイル間でオブジェクト認識を達成する課題に対処すること。
  • 人間の表現スタイルに依存しない認識性能と機械の性能のギャップを縮小し、1つのモデルが複数のスタイルに一般化できるようにすること。
  • 手作業で設計されたモジュールや複雑なドメイン適応に依存せず、表現固有の特徴と表現に依存しない特徴を同時に学習するエンドツーエンドの深層学習フレームワークを設計すること。
  • トランスファー学習やドメイン適応の限界を克服し、入力が適切なスタイル固有サブネットワークにルーティングされるように、学習可能で動的なスイッチングメカニズムを導入すること。

提案手法

  • SwiDeN は、共有トランクと2つの並列サブネットワーク(写真表現に最適化されたものと、芸術的/図解的表現に最適化されたもの)を持つ二重ブランチアーキテクチャを採用している。
  • 「深層」の表現スタイル分類器(「スイッチ」)が、入力画像の視覚的スタイルに基づいて、適切なサブネットワークに動的にルーティングすることで、スタイル固有の特徴学習を可能にしている。
  • スイッチメカニズムは、ネットワークの残りの部分と同時にエンドツーエンドで学習されるため、視覚的ヒントに基づいて、いつ、どのように入力をルーティングするかを学習できる。
  • ベースネットワークとして VGG-19 を使用し、各サブネットワークに別々の学習率を設定(「アート」サブネットワークでは4倍の高い学習率を設定し、写真中心の事前学習バイアスを補償)。
  • スタイル固有の処理後に共有層からの特徴を統合し、その後にソフトマックス分類器を用いて最終予測を行う。
  • モデルは、データオーグメンテーション(RGB ジッタリング、水平反転、アート画像向けの形態的操作)を用いて学習され、テスト画像では5クロップ平均を用いて評価された。

実験結果

リサーチクエスチョン

  • RQ11つの深層ニューラルネットワークが、写真、スケッチ、ドローイングなどの複数の表現スタイルに特化せずに、高い正確度を達成できるか?
  • RQ2スタイル固有サブネットワーク間で動的かつ学習可能なスイッチングメカニズムは、標準的なファインチューニングやドメイン適応と比較して、クロス表現認識においてどのように優れているか?
  • RQ3スイッチングによってスタイル固有の特徴学習と組み合わせた共有表現が、どの程度表現に依存しない特徴を学習できるか?
  • RQ4スタイル固有サブネットワークの深さが、特に非写真的表現において、モデルのスタイル間一般化能力に与える影響は何か?

主な発見

  • SwiDeN は Photo-Art-50 データセットで全体の分類正確度が 94.42% を達成し、ベースライン(93.80%)および勾配逆転ネットワーク(GRN、92.64%)のアーキテクチャを上回った。
  • 「アート」表現では 91.12% の正確度を達成し、ベースライン(89.80%)および GRN(88.52%)を大きく上回り、非写真的スタイルへの有効性を示した。
  • SwiDeN の C4-S バリエーションが、すべての SwiDeN アーキテクチャの中で最高の性能を示し、全体の正確度が 94.42% に達した。これは、スタイル固有サブネットワークに最適な深さが得られたことを示している。
  • SwiDeN は Wu ら [16] のマルチアトリビュートパーツグラフモデルを上回り、クラスのバイアスがかかる分割条件でも 93.02% の全体正確度を達成したのに対し、彼らの結果は 89.67% であった。
  • SwiDeN では「写真」と「アート」の正確度の差が最小限に抑えられており(97.72% 対 91.12%)、ベースライン(97.80% 対 89.80%)よりもバランスが取れている。
  • 結果から、動的スイッチングメカニズムが GRN で用いられる間接的フィードバック機構よりも、スタイル固有特徴の学習をより効果的に行えることが示唆された。GRN は類似の設計原理を有しながらも、性能が劣っていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。