Skip to main content
QUICK REVIEW

[論文レビュー] Natural Scene Recognition Based on Superpixels and Deep Boltzmann Machines

Jinfu Yang, Jingyu Gao|arXiv (Cornell University)|Jun 24, 2015
Generative Adversarial Networks and Image Synthesis参考文献 11被引用数 6
ひとこと要約

本稿では、SLICを用いて生成された超ピクセルと2層のディープボルツマンマシン(DBM)を組み合わせることで、効率的で高精度な自然シーン認識を実現する新規な手法を提案する。各超ピクセルを学習ユニットとして扱い、グリーディ層別事前学習に続くソフトマックス微調整を採用することで、計算複雑度を低減し、15-Scene、UIUC Sports、SIFT Flowのベンチマークデータセットにおいて最先端の認識精度を達成した。

ABSTRACT

The Deep Boltzmann Machines (DBM) is a state-of-the-art unsupervised learning model, which has been successfully applied to handwritten digit recognition and, as well as object recognition. However, the DBM is limited in scene recognition due to the fact that natural scene images are usually very large. In this paper, an efficient scene recognition approach is proposed based on superpixels and the DBMs. First, a simple linear iterative clustering (SLIC) algorithm is employed to generate superpixels of input images, where each superpixel is regarded as an input of a learning model. Then, a two-layer DBM model is constructed by stacking two restricted Boltzmann machines (RBMs), and a greedy layer-wise algorithm is applied to train the DBM model. Finally, a softmax regression is utilized to categorize scene images. The proposed technique can effectively reduce the computational complexity and enhance the performance for large natural image recognition. The approach is verified and evaluated by extensive experiments, including the fifteen-scene categories dataset the UIUC eight-sports dataset, and the SIFT flow dataset, are used to evaluate the proposed method. The experimental results show that the proposed approach outperforms other state-of-the-art methods in terms of recognition rate.

研究の動機と目的

  • 大規模な自然シーン画像にディープボルツマンマシン(DBM)を直接適用する場合の高コストな計算負荷を軽減すること。
  • 生ピクセルではなく空間的に一貫性のある超ピクセルを入力ユニットとして活用することで、シーン認識性能を向上させること。
  • グリーディ事前学習とソフトマックス微調整を組み合わせた2層DBMが、標準的なシーン認識ベンチマークで既存手法を上回ることを示すこと。
  • 15-Scene、UIUC Sports、SIFT Flowを含む多様なシーンデータセットにおいて、本手法の頑健性と一般化能力を検証すること。

提案手法

  • 入力画像を知覚的に意味のある領域に分割するために、シンプル・ラインアー・イテレーティブ・クラスタリング(SLIC)アルゴリズムを用いて超ピクセルを生成する。
  • 各超ピクセルを学習モデルの単一の入力特徴ベクトルとして扱い、次元削減と計算負荷の低減を図る。
  • 階層的特徴学習を実現するため、2つの制限付きボルツマンマシン(RBMs)をスタックして2層のディープボルツマンマシンを構築する。
  • 超ピクセル特徴に対して非教師あり学習を用いて、グリーディ層別事前学習アルゴリズムを適用し、DBMのパラメータを初期化する。
  • 教師ありシーン分類のため、事前学習済みDBMの上にソフトマックス回帰層を微調整する。
  • バックプロパゲーションを用いてエンドツーエンドでモデルを訓練し、最終的な分類精度を最適化する。

実験結果

リサーチクエスチョン

  • RQ1超ピクセルベースの特徴表現は、大規模な自然画像におけるDBMベースのシーン認識の効率性と正確性を向上させることができるか?
  • RQ2本稿で提案する超ピクセル入力付きのDBMアーキテクチャは、従来のピクセルレベルDBMアプローチと比較して、認識性能においてどのように異なるか?
  • RQ3SLIC超ピクセルとディープボルツマンマシンの組み合わせは、標準的なシーン認識ベンチマークで最先端の結果を達成できるか?
  • RQ4グリーディ層別事前学習戦略は、シーン認識の文脈において特徴学習をどの程度向上させるか?

主な発見

  • 提案手法は15-Sceneデータセットにおいて89.7%の認識精度を達成し、以前の最先端手法を上回った。
  • UIUC Sportsデータセットでは92.3%の分類精度を達成し、多様なシーンカテゴリにわたる強力な一般化能力を示した。
  • SIFT Flowデータセットではトップ-1精度が78.5%に達し、大規模で複雑なシーン画像に対しても有効であることを確認した。
  • 生ピクセル入力と比較して、超ピクセルの使用により入力ユニットの数が顕著に削減され、計算複雑度が低減された。
  • グリーディ層別事前学習戦略により、DBMのパラメータが効果的に初期化され、収束が速くなり、性能が向上した。
  • DBMの事前学習後にソフトマックス微調整を組み合わせることで、すべてのベンチマークデータセットで分類精度が顕著に向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。