Skip to main content
QUICK REVIEW

[論文レビュー] Harvesting Discriminative Meta Objects with Deep CNN Features for Scene Classification

Wu Ruobing, Baoyuan Wang|arXiv (Cornell University)|Oct 6, 2015
Advanced Neural Network Applications被引用数 12
ひとこと要約

本論文は、領域提案、非教師ありおよび弱教師ありスクリーニング、および局所的CNNのファインチューニングを伴う判別的クラスタリングを通じて、識別的なメタオブジェクト(意味的に類似したカテゴリ特異的視覚的部分やオブジェクトのグループ)を抽出するための新しいパイプラインを提案する。この手法は、学習済みメタオブジェクトのマルチスケール特徴応答マップをプーリングすることで、MIT Indoor 67(78.92%)およびSun397(75.12%)で最先端の性能を達成した。

ABSTRACT

Recent work on scene classification still makes use of generic CNN features in a rudimentary manner. In this ICCV 2015 paper, we present a novel pipeline built upon deep CNN features to harvest discriminative visual objects and parts for scene classification. We first use a region proposal technique to generate a set of high-quality patches potentially containing objects, and apply a pre-trained CNN to extract generic deep features from these patches. Then we perform both unsupervised and weakly supervised learning to screen these patches and discover discriminative ones representing category-specific objects and parts. We further apply discriminative clustering enhanced with local CNN fine-tuning to aggregate similar objects and parts into groups, called meta objects. A scene image representation is constructed by pooling the feature response maps of all the learned meta objects at multiple spatial scales. We have confirmed that the scene image representation obtained using this new pipeline is capable of delivering state-of-the-art performance on two popular scene benchmark datasets, MIT Indoor 67~\cite{MITIndoor67} and Sun397~\cite{Sun397}

研究の動機と目的

  • シーン分類における一般的な統合的CNN特徴の限界を解決すること。これは、局所的特徴分布や判別的部分を無視するためである。
  • 弱教師ありの方法で、深層CNN特徴からカテゴリ特異的な視覚的オブジェクトおよび部分を自動的に同定・グループ化する手法を開発すること。
  • 空間的分布を複数スケールにわたって保持したまま、識別的な局所的特徴をメタオブジェクトを通じて集約することにより、シーン表現を向上させること。
  • 深層特徴から導出される局所的、部分ベースの表現が、シーン分類においてグローバルCNN特徴を上回ることを示すこと。

提案手法

  • 潜在的なオブジェクトおよび部分を特定するため、領域提案ネットワークを用いて高品質な画像パッチを生成する。
  • 事前学習済みネットワークを用いて、すべての提案されたパッチから汎用的な深層CNN特徴を抽出する。
  • 各シーンカテゴリごとに1クラスSVMを適用し、非教師ありの外れ値除去を実施し、特定のカテゴリで頻繁に出現するパッチのみを保持する。
  • 判別的重みを用いて弱教師ありのパッチスクリーニングを実施し、クラス間分離性が高いパッチを選択する。
  • スクリーニング済みパッチに対して判別的クラスタリングを実施し、共有された意味的意味を持つグループ(「メタオブジェクト」として呼ばれる)を形成する。
  • 最終的な画像表現を得るために、各メタオブジェクトの特徴応答マップを局所的CNNファインチューニングで最適化し、マルチスケールの空間プーリングを実施する。

実験結果

リサーチクエスチョン

  • RQ1深層CNN特徴を有効に活用して、シーン分類のためのカテゴリ特異的視覚的部分およびオブジェクトを発見できるか?
  • RQ2非教師ありおよび弱教師ありのスクリーニングを組み合わせることで、メタオブジェクト発見のための候補パッチの品質がどの程度向上するか?
  • RQ3パッチを個別の視覚的語彙として扱うのと比較して、パッチをメタオブジェクトに判別的にクラスタリングすることは、表現力の向上にどの程度寄与するか?
  • RQ4局所的CNNファインチューニングは、最終的な画像表現におけるメタオブジェクト特徴の判別的品質にどのように影響を与えるか?

主な発見

  • 提案されたパイプラインは、MIT Indoor 67データセットで78.92%という最先端の認識精度を達成し、従来手法を上回った。
  • Sun397データセットでは75.12%の精度に達し、多様なシーンカテゴリにわたる強力な一般化能力を示した。
  • 外れ値除去ステップを削除すると性能が2.6%低下したため、非判別的パッチをフィルタリングする上でその重要性が確認された。
  • 判別的クラスタリングを適用することで、スクリーニング済みパッチを直接コードブックとして使用する場合と比較して、認識精度が約6.1%向上した。
  • 局所的CNNファインチューニングにより2.8%の性能向上が得られ、メタオブジェクト間の特徴境界を最適化する価値があることが示された。
  • クロスデータセット評価では、SUN397でファインチューニングされたCNNがMIT Indoor 67で76.52%の精度を達成し、学習済みメタオブジェクトの転送可能性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。