Skip to main content
QUICK REVIEW

[論文レビュー] Graph-Based Classification of Omnidirectional Images

Renata Khasanova, Pascal Frossard|arXiv (Cornell University)|Jul 26, 2017
Advanced Image and Video Retrieval Techniques参考文献 27被引用数 16
ひとこと要約

本論文は、魚眼およびキャタディオプトリックカメラの球面幾何構造を明示的にモデル化する、グラフベースのディープラーニング手法を提案する。歪みのある画像領域間の等長関係を保持する幾何学に配慮したグラフを構築することで、同じ物体が位置やレンズ歪みに関係なく一貫した応答を示す畳み込みフィルタを実現し、ETH-80データセットで80.7%の正確性を達成した。これは最先端手法を最大4.0ポイント上回った。

ABSTRACT

Omnidirectional cameras are widely used in such areas as robotics and virtual reality as they provide a wide field of view. Their images are often processed with classical methods, which might unfortunately lead to non-optimal solutions as these methods are designed for planar images that have different geometrical properties than omnidirectional ones. In this paper we study image classification task by taking into account the specific geometry of omnidirectional cameras with graph-based representations. In particular, we extend deep learning architectures to data on graphs; we propose a principled way of graph construction such that convolutional filters respond similarly for the same pattern on different positions of the image regardless of lens distortions. Our experiments show that the proposed method outperforms current techniques for the omnidirectional image classification problem.

研究の動機と目的

  • 標準の平面画像向けに設計された畳み込みニューラルネットワークの性能を著しく低下させる、オムニディレクショナル画像における幾何的歪みの課題に対処すること。
  • オムニディレクショナルカメラの投影における球面幾何構造を内蔵的に考慮する、グラフベースのディープラーニングアーキテクチャを開発すること。
  • 同じ物体が異なる画像位置に存在しても、深刻なレンズ歪みがあっても一貫したフィルタ応答を保証するグラフ構造を構築すること。
  • グラフ信号処理フレームワークにカメラ固有の幾何的制約を組み込むことで、オムニディレクショナル画像データセットにおける分類正確性を向上させること。

提案手法

  • 本手法は、球面投影モデルを用いてオムニディレクショナル画像のグラフ表現を構築し、ノードを画像ピクセルに対応させ、エッジは球面上の測地的距離に基づいて定義する。
  • 等長関係を保持する幾何学的配慮のあるグラフ構築法を採用し、等長性を保証することで、同じパターンが等距離の位置にあろうと、一貫した応答を示す。
  • TIGraNet—グラフベースのディープラーニングモデル—を拡張し、その正規格子グラフを球面的で幾何学的配慮のあるグラフに置き換えることで、歪みに対する不変性を向上させる。
  • 畳み込みフィルタは、チェビシェフ多項式近似を用いてグラフ上に適用し、不規則なドメインにおける局所的かつ空間的に適応的な特徴学習を可能にする。
  • ネットワークアーキテクチャには、10および20のフィルタを有する2つの畳み込み層と、300、200、100のニューロンを有する3つの全結合層が含まれており、フィルタサイズは5×5、多項式次数は5または10である。
  • 本手法はETH-80データセットを用いて評価され、比較手法と同等のパラメータ数を確保するようにハイパーパramータを調整して、公平な比較が行われた。

実験結果

リサーチクエスチョン

  • RQ1グラフベースのディープラーニングフレームワークは、標準のConvNetに比べ、オムニディレクショナル画像における幾何的歪みに対してより高い不変性を達成できるか?
  • RQ2グラフ構造に球面幾何を組み込むことで、特徴の一貫性と分類正確性にどのような影響を与えるか?
  • RQ3幾何学的配慮のあるグラフは、オムニディレクショナル画像分類のためのグラフ畳み込みニューラルネットワークにおいて、標準のグリッドベースのグラフを上回る性能を発揮するか?
  • RQ4本手法は、等距離投影上での物体の位置や方向に起因する感度をどの程度低減するか?

主な発見

  • 提案手法はETH-80データセットで80.7%の分類正確性を達成し、次に優れた手法(ChebNet-geometry)を2.1ポイント上回った。
  • 幾何学的配慮のあるグラフ構築法により、異なる物体位置における特徴の分散が低減され、歪みの異なる位置に存在しても同じ物体に対するフィルタ応答が一貫した。
  • 正規格子上でのTIGraNetと比較して、提案手法は正確性を74.2%から80.7%に向上させ、グラフ構造における幾何モデリングの利点を示した。
  • 同様のベンチマークで、標準ConvNet(76.7%)およびSpatial Transformer Networks(73.1%)をそれぞれ4.0ポイントおよび7.6ポイント上回った。
  • この向上は、等長不変性と幾何学的配慮のあるグラフトポロジーの組み合わせに起因し、グローバルな特徴表現を強化するとともに、局所的パターンの一貫性を維持した。
  • 実験により、本手法のグラフベースアーキテクチャは、グリッドベースの対応手法よりも一般化性能に優れ、特に物体外観の歪みに起因する変動の処理に優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。