Skip to main content
QUICK REVIEW

[論文レビュー] Improving Image Classification with Location Context

Kevin Tang, Manohar Paluri|arXiv (Cornell University)|May 14, 2015
Advanced Image and Video Retrieval Techniques参考文献 38被引用数 4
ひとこと要約

本稿では、画像分類の性能向上を図るために、GPSで得られる位置情報のコンテキストを畳み込みニューラルネットワーク(CNN)に統合する手法を提案する。5種類の新しい位置特徴を設計し、CNN内で最適なプーリング半径をエンドツーエンドで学習可能にする仕組みを導入することで、新しい地理的タグ付け済みデータセット上で平均平均精度(mean average precision)を7%相対的に向上させた。この結果、位置情報コンテキストが場所に依存する視覚的コンセプトの認識を顕著に向上させることを示した。

ABSTRACT

With the widespread availability of cellphones and cameras that have GPS capabilities, it is common for images being uploaded to the Internet today to have GPS coordinates associated with them. In addition to research that tries to predict GPS coordinates from visual features, this also opens up the door to problems that are conditioned on the availability of GPS coordinates. In this work, we tackle the problem of performing image classification with location context, in which we are given the GPS coordinates for images in both the train and test phases. We explore different ways of encoding and extracting features from the GPS coordinates, and show how to naturally incorporate these features into a Convolutional Neural Network (CNN), the current state-of-the-art for most image classification and recognition problems. We also show how it is possible to simultaneously learn the optimal pooling radii for a subset of our features within the CNN framework. To evaluate our model and to help promote research in this area, we identify a set of location-sensitive concepts and annotate a subset of the Yahoo Flickr Creative Commons 100M dataset that has GPS coordinates with these concepts, which we make publicly available. By leveraging location context, we are able to achieve almost a 7% gain in mean average precision.

研究の動機と目的

  • GPS座標をコンテキスト的事前知識として組み込むことで、画像分類の性能を向上させること。
  • 緯度・経度を超えた地理的コンテキストを捉える、データ駆動型の特徴をGPS座標から設計すること。
  • 視覚的特徴と位置ベースの特徴を同時に学習するCNNアーキテクチャを構築し、エンドツーエンド最適化を可能とすること。
  • ディープラーニングフレームワーク内で、位置特徴の最適な空間的プーリング半径を自動で学習可能とすること。
  • 位置に敏感な画像分類の評価を可能とする、公開可能な大規模な地理的タグ付け済み画像データセット(YFCC100M-GEO100)を構築・公開すること。

提案手法

  • GPS座標と外部地理データセットから得られる5種類の位置コンテキスト特徴(ハッシュタグコンテキスト、視覚的コンテキスト、土地被覆、標高、気候)を提案する。
  • 視覚的特徴と位置特徴を全結合層で連結し、その後にクロス特徴相互作用をモデル化するための連結後処理層を設けることで、CNNにこれらの特徴を統合する。
  • 固定半径のヒストグラムプーリングを、学習可能な半径層(RL10)の複数コピーに置き換えることで、特徴集約に最適な空間スケールを自動的に決定可能とする。
  • 確率的勾配降下法を用いて、視覚的特徴、位置特徴、および半径パラメータを同時に最適化するエンドツーエンドの学習を実施する。
  • 過学習を回避するため、分類の前段で256次元の全結合層を最終表現として使用し、より深いまたは大きな層を避ける。
  • 88,986枚の地理的タグ付け済み画像(100の場所に依存するコンセプトに分類)を含むYFCC100M-GEO100データセットを、学習および評価に使用する。

実験結果

リサーチクエスチョン

  • RQ1GPS座標をコンテキスト的事前知識として用いることで、画像分類の精度を顕著に向上させることができるか?
  • RQ2土地被覆、標高、気候などの位置から導出される特徴のうち、視覚的認識の向上に最も効果的なものは何か?
  • RQ3ディープラーニングモデルが、手動で調整された値に頼らずに、位置特徴の最適な空間的プーリング半径を自動で学習できるか?
  • RQ4位置コンテキストの統合は、細分化された場所固有の視覚的コンセプトに対する性能にどのように影響を与えるか?
  • RQ5モデルの性能は、多様な地理的および意味的コンセプトにわたってどれほど一般化可能か?

主な発見

  • 提案手法は、画像のみを対象としたベースラインモデルと比較して、平均平均精度(mean average precision)を7%相対的に向上させた(36.82%から43.78%に向上)。
  • 最も優れた性能を示したモデルは、すべての5つの位置特徴を用い、256次元の表現と10個の半径学習層のコピー(256/- RL10)を採用し、43.78%の平均APを達成した。
  • 『ディズニーランド』『カジノ』『アラカツル』といった場所固有のコンセプトでは、最も大きな性能向上が観察され、強い局所化効果が示された。
  • モデルは、異なるコンセプトに対して異なるプーリング半径を学習する:『海岸』や『緑地』では3個以下の半径に収束するが、『建物』では広い範囲をカバーする。これは、文脈に応じた空間スケールの違いを反映している。
  • 連結後処理層を追加すると過学習が生じるため、最終モデルとして、この層を含まない256/- RL10の構成が選択された。
  • 88,986枚の地理的タグ付け済み画像(100クラス)を含むYFCC100M-GEO100データセットは、位置に敏感なビジョン分野の今後の研究を支援する目的で公開された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。