Skip to main content
QUICK REVIEW

[論文レビュー] Scene Recognition by Combining Local and Global Image Descriptors

Jobin Wilson, Muhammad Arif|arXiv (Cornell University)|Feb 21, 2017
Advanced Image and Video Retrieval Techniques参考文献 3被引用数 3
ひとこと要約

本論文では、DAISY局所特徴量とHOG全局特徴量を2段階のプーリング戦略とミニバッチK-平均法を用いて組み合わせるハイブリッドシーン認識パイプラインを提案する。この手法は、SVM分類器を用いて15シーンデータセットで76.4%の精度を達成し、単独で使用するいずれの特徴量タイプよりも優れた性能を発揮した。

ABSTRACT

Object recognition is an important problem in computer vision, having diverse applications. In this work, we construct an end-to-end scene recognition pipeline consisting of feature extraction, encoding, pooling and classification. Our approach simultaneously utilize global feature descriptors as well as local feature descriptors from images, to form a hybrid feature descriptor corresponding to each image. We utilize DAISY features associated with key points within images as our local feature descriptor and histogram of oriented gradients (HOG) corresponding to an entire image as a global descriptor. We make use of a bag-of-visual-words encoding and apply Mini- Batch K-Means algorithm to reduce the complexity of our feature encoding scheme. A 2-level pooling procedure is used to combine DAISY and HOG features corresponding to each image. Finally, we experiment with a multi-class SVM classifier with several kernels, in a cross-validation setting, and tabulate our results on the fifteen scene categories dataset. The average accuracy of our model was 76.4% in the case of a 40%-60% random split of images into training and testing datasets respectively. The primary objective of this work is to clearly outline the practical implementation of a basic screne-recognition pipeline having a reasonable accuracy, in python, using open-source libraries. A full implementation of the proposed model is available in our github repository.

研究の動機と目的

  • 適切な精度を達成しつつ、オープンソースのPythonライブラリを用いた実用的でエンドツーエンドのシーン認識パイプラインを開発すること。
  • 局所的(DAISY)および全局的(HOG)画像特徴量を統合することで、ハイブリッド特徴量記述子を構築し、分類性能を向上させること。
  • 標準K-平均法ではなくミニバッチK-平均法を用いることで、特徴量符号化における計算複雑性を低減すること。
  • SVMカーネルおよびハイパーパrameterの違いが、シーン認識精度に与える影響を評価すること。
  • 正規化されたDAISYヒストグラムとL2正規化されたHOG特徴量を組み合わせる2段階プーリング戦略の有効性を示すこと。

提案手法

  • 局所的画像表現のため、scikit-imageライブラリを用いてキーポoin特徴量からDAISY特徴量を抽出する。
  • 全画像からの全局的HOG特徴量を、設定可能なパラメータ(pixels_per_cell、cells_per_block、orientations)を用いて抽出する。
  • すべての訓練用DAISY特徴量に対してミニバッチK-平均法を用いてクラスタリングし、ビジュアルボキャブラリーを構築することで、Bag-of-Visual-Words符号化を可能にする。
  • 各DAISY特徴量を最も近いクラスタに割り当て、出現回数を数えることで、各画像をビジュアルワードのヒストグラム(DAISYヒストグラム)に符号化する。
  • DAISYヒストグラムとHOG特徴量の両方にL2正規化を適用し、それらを連結してハイブリッド特徴ベクトルを構築する。
  • ハイブリッド特徴量を用いて、5分割交差検証を実行しながら、多クラスSVM分類器をさまざまなカーネル(線形、RBF)で学習する。

実験結果

リサーチクエスチョン

  • RQ1DAISY(局所的)とHOG(全局的)の両方の画像特徴量を組み合わせることで、単独で使用する場合と比較して、シーン認識精度にどのような影響を与えるか?
  • RQ2このハイブリッドフレームワークにおけるBag-of-Visual-Words表現の最適なビジュアルボキャブラリーのサイズ(K)は何か?
  • RQ3さまざまなSVMカーネル(線形対RBF)およびハイパーパrameter(C、γ)は、分類性能にどのように影響するか?
  • RQ4正規化および連結されたDAISYおよびHOG特徴量を組み合わせる2段階プーリング戦略は、モデルのロバスト性と精度をどの程度向上させるか?
  • RQ5大規模な特徴量符号化において、標準K-平均法と比較してミニバッチK-平均法を用いることで、計算時間はどの程度短縮されるか?

主な発見

  • DAISYおよびHOG特徴量を両方使用したハイブリッドモデルは、1.9百万の特徴量を含む15シーンデータセットで、40%-60%の訓練・テスト分割において76.4%の精度を達成した。
  • HOG特徴量のみを用いた場合、精度はわずか59.1%にとどまり、スケール、方向、平行移動の変化に対する耐性に限界があることが示された。
  • DAISY特徴量のみを用いた場合、70.8%の精度を達成し、局所的なテクスチャおよび構造を捉える強みが確認された。
  • 両特徴量の組み合わせは、個別のモデルをはるかに上回り、特徴表現における相補的な強みが顕著に現れた。
  • ミニバッチK-平均法は、標準K-平均法が数時間かかっていた符号化時間を、K=600の条件下で約45秒にまで短縮した。
  • 混同行列の結果から、誤分類は人間の観察者に対しても視覚的に曖昧なシーン同士の誤認識が多く、データセット自体の複雑さが顕著に現れた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。