Skip to main content
QUICK REVIEW

[論文レビュー] Latent Model Ensemble with Auto-localization

Miao Sun, Tony Xiao Han|arXiv (Cornell University)|Apr 15, 2016
Advanced Neural Network Applications参考文献 28被引用数 6
ひとこと要約

本論文は、顕在変数として最も判別性の高い画像領域を自動的に特定・注目する潜在的畳み込みニューラルネットワーク(CNN)フレームワークを提案し、不要な背景領域による干渉を低減することで分類精度を向上させている。新規の潜在モデルアンサンブルを用いてグローバルCNNとパーツベースの潜在CNNを統合することで、CIFAR-10、CIFAR-100、MNIST、PASCAL VOC 2007で最先端の性能を達成し、それぞれ8.13%、32.31%、0.42%、15.4%の誤差率を記録した。

ABSTRACT

Deep Convolutional Neural Networks (CNN) have exhibited superior performance in many visual recognition tasks including image classification, object detection, and scene label- ing, due to their large learning capacity and resistance to overfit. For the image classification task, most of the current deep CNN- based approaches take the whole size-normalized image as input and have achieved quite promising results. Compared with the previously dominating approaches based on feature extraction, pooling, and classification, the deep CNN-based approaches mainly rely on the learning capability of deep CNN to achieve superior results: the burden of minimizing intra-class variation while maximizing inter-class difference is entirely dependent on the implicit feature learning component of deep CNN; we rely upon the implicitly learned filters and pooling component to select the discriminative regions, which correspond to the activated neurons. However, if the irrelevant regions constitute a large portion of the image of interest, the classification performance of the deep CNN, which takes the whole image as input, can be heavily affected. To solve this issue, we propose a novel latent CNN framework, which treats the most discriminate region as a latent variable. We can jointly learn the global CNN with the latent CNN to avoid the aforementioned big irrelevant region issue, and our experimental results show the evident advantage of the proposed latent CNN over traditional deep CNN: latent CNN outperforms the state-of-the-art performance of deep CNN on standard benchmark datasets including the CIFAR-10, CIFAR- 100, MNIST and PASCAL VOC 2007 Classification dataset.

研究の動機と目的

  • 画像に大きな不要な背景領域が存在する場合に生じる深層CNNの性能低下を是正すること。
  • 最も判別性の高い画像領域を顕在変数として扱うフレームワークを構築し、特徴抽出の改善を図ること。
  • グローバルCNNとパーツベースCNNの予測をより効果的に統合できる、新しいアンサンブル手法「潜在モデルアンサンブル」を導入すること。
  • CIFAR-10、CIFAR-100、MNIST、PASCAL VOC 2007といった標準ベンチマークで最先端の性能を達成すること。

提案手法

  • フレームワークは、画像全体を処理するグローバルCNNと、複数の切り出しパッチを処理するパーツベースCNNを用いる。
  • パーツベースの検出をモデル化するために潜在SVMが用いられ、最も活性化されたパッチ(すなわち、最も判別性の高い領域)が顕在変数として選択される。
  • 潜在モデルアンサンブルは、グローバルCNNと最良のローカルパッチの予測を融合戦略によって統合し、一般化性能を向上させる。
  • 確率的勾配降下法を用いてマルチクラス潜在SVMを学習し、顕在領域選択と分類のエンドツーエンド最適化を可能にする。
  • 深層特徴抽出のため、NIN(Network-in-Network)アーキテクチャにmlpconv層、グローバル平均プーリング、ドロップアウトを適用する。
  • 各画像に対して10個のランダムパッチを抽出し、最良のパッチからの応答をアルゴリズム2を用いてグローバル画像応答と融合する。

実験結果

リサーチクエスチョン

  • RQ1全画像を対象とせず、最も判別性の高い画像領域に注目することで、視覚分類タスクにおける深層CNNの性能向上が図れるか?
  • RQ2不要な背景領域を含む画像を処理する際、顕在変数に基づくCNNフレームワークは、従来のグローバルCNNに比べてどのように優れているか?
  • RQ3グローバルCNNとパーツベースCNNの予測を統合する新しいアンサンブル手法は、従来の平均化や投票戦略を上回る性能を発揮できるか?
  • RQ4提案された潜在モデルアンサンブルは、CIFAR-10、CIFAR-100、MNIST、PASCAL VOC 2007といった標準ベンチマークで最先端の性能を達成できるか?

主な発見

  • 提案された2CNN-潜在法は、CIFAR-10でテスト誤差率8.13%を達成し、NINベースラインより0.68ポイントの改善を示した。
  • CIFAR-100では32.31%の誤差率を記録し、NINベースラインより2.0ポイントの改善を達成した。
  • MNISTでは0.42%の誤差率を達成し、NINベースラインより0.05ポイントの改善を示した。
  • 潜在モデルアンサンブルは、すべてのデータセットで標準的な平均化(2CNN-average)を上回る性能向上を示し、融合戦略の有効性を裏付けた。
  • PASCAL VOC 2007では15.4%の誤差率を記録し、複数ラベルやごみだらけの背景を持つ複雑な実世界画像に対しても優れた一般化性能を示した。
  • アブレーションスタディにより、顕在CNNフレームワークが不要な領域からの干渉を低減することが確認され、特に「鉢植えの植物」や「船+人間」のように物体が小さかったり部分的に隠れていたりする画像において顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。