Skip to main content
QUICK REVIEW

[論文レビュー] Deep Texture Manifold for Ground Terrain Recognition

Jia Xue, Hang Zhang|arXiv (Cornell University)|Mar 29, 2018
Advanced Image and Video Retrieval Techniques参考文献 32被引用数 10
ひとこと要約

本稿では、順序なしテクスチャ特徴と局所的な空間的情報を組み合わせることで、より優れた地上地形認識を実現する深層符号化プーリングネットワーク(DEP)を提案する。この手法は、GTOSおよびGTOS-mobileデータセットにおいて最先端の性能を達成している。さらに、DEP-manifoldと呼ばれるパラメトリックなテクスチャ多様体を導入し、2次元空間における判別性の高いクラス構造の埋め込みを学習することで、曖昧なクラス境界の表現と分布外一般化の両方を可能にしている。

ABSTRACT

We present a texture network called Deep Encoding Pooling Network (DEP) for the task of ground terrain recognition. Recognition of ground terrain is an important task in establishing robot or vehicular control parameters, as well as for localization within an outdoor environment. The architecture of DEP integrates orderless texture details and local spatial information and the performance of DEP surpasses state-of-the-art methods for this task. The GTOS database (comprised of over 30,000 images of 40 classes of ground terrain in outdoor scenes) enables supervised recognition. For evaluation under realistic conditions, we use test images that are not from the existing GTOS dataset, but are instead from hand-held mobile phone videos of similar terrain. This new evaluation dataset, GTOS-mobile, consists of 81 videos of 31 classes of ground terrain such as grass, gravel, asphalt and sand. The resultant network shows excellent performance not only for GTOS-mobile, but also for more general databases (MINC and DTD). Leveraging the discriminant features learned from this network, we build a new texture manifold called DEP-manifold. We learn a parametric distribution in feature space in a fully supervised manner, which gives the distance relationship among classes and provides a means to implicitly represent ambiguous class boundaries. The source code and database are publicly available.

研究の動機と目的

  • ロボットや自動運転車両における地上地形認識を、順序なしテクスチャと局所的な空間的構造の両方を統合することで向上させること。
  • アスファルトと石アスファルト、あるいは芝と落葉など、視覚的に類似した素材が存在する実世界の地形データセットにおける曖昧なクラス境界の課題に対処すること。
  • 2次元空間に連続的かつ判別性の高い地形クラスの埋め込みを学習するパラメトリックなテクスチャ多様体(DEP-manifold)を構築すること。
  • DEPネットワークが、学習時に使用されなかった新しいモバイル端末で撮影されたデータとは異なる実世界の条件下でも、認識性能を適切に発揮するかを評価すること。
  • 将来的な地形認識およびテクスチャ多様体学習の研究を支援するため、公開可能なデータセットとコードベースを提供すること。

提案手法

  • DEPネットワークは二重ブランチの特徴抽出を採用する。一方のブランチでは、順序なしテクスチャの外観を捉えるために深層符号化層を適用し、もう一方ではグローバル平均プーリングを用いて局所的な空間的構造を保持する。
  • 両ブランチからの特徴は、双線形モデルを用いて融合され、判別性の高いテクスチャ情報と空間的情報が統合される。
  • DEPネットワークは、交差エントロピー損失と標準的なCNN最適化手法を用いて、GTOSデータセット(30,000枚以上の画像、40クラス)上でエンドツーエンドで訓練される。
  • DEP-manifoldは、まずBarnes-Hut t-SNEを用いてDEP特徴の非パラメトリックな2次元埋め込みを学習し、その後、その2次元座標をDEP特徴から直接予測する深層ニューラルネットワークを教師ありの方法で訓練することで構築される。
  • 埋め込みネットワークは、バッチ正則化とReLU活性化関数を用い、L2損失で学習を開始から行い、80エポックにわたり減少する初期学習率0.01で最適化される。
  • この手法により、サンプル外への拡張が可能となり、類似した素材が空間的に近接する滑らかでクラスが整列した2次元多様体が得られる。

実験結果

リサーチクエスチョン

  • RQ1順序なしテクスチャと局所的な空間的構造を同時にモデル化する深層学習モデルは、既存の手法を上回る性能を示すことができるか?
  • RQ2曖昧な境界付近においても、地形クラスの内在的構造を的確に表現できるパラメトリックなテクスチャ多様体をどのように学習できるか?
  • RQ3提案されたDEPネットワークは、学習時に使用されなかった実世界のハンドヘルドモバイル動画データに対しても、良好な一般化性能を示すか?
  • RQ4DEP-manifoldは、視覚的類似性を反映した意味的で連続的かつ判別性の高い地形素材の2次元埋め込みを提供できるか?
  • RQ5MINCやDTDのようなドメイン外だがドメイン内に属する地形データセットでは、システムの性能はどの程度か?

主な発見

  • DEPネットワークはGTOSデータセットで最先端の性能を達成し、MINCおよびDTDデータセットへの一般化能力も強く示している。
  • 新しく収集されたGTOS-mobileデータセット(81本の動画、31種類の地形、スマートフォンで撮影)において、DEPは変動する照明条件や視点条件下でも安定した性能を示している。
  • DEP-manifoldは、DEPパラメトリックt-SNEと比較して、より均一でクラスが整列した2次元埋め込みを生成しており、混雑やスパarsityが低減されている。
  • DEP-manifoldの可視化において、誤分類された画像はしばしば正しく分類されるクラスの近くに投影されており、多様体が意味的な視覚的類似性を適切に捉えていることが示されている。
  • DEP認識の混同行列では、非対角成分が最小限に抑えられており、存在するものも通常は対角線に近接している。これは、誤分類が主に意味的に類似した地形クラス間で発生していることを示している。
  • DEP-manifoldの学習は、NVIDIA Titan Xを用いて5分未満で完了するため、計算効率が非常に高い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。