Skip to main content
QUICK REVIEW

[論文レビュー] Identifying Most Walkable Direction for Navigation in an Outdoor Environment

Sachin Mehta, Hannaneh Hajishirzi|arXiv (Cornell University)|Nov 21, 2017
Video Surveillance and Tracking Methods参考文献 61被引用数 4
ひとこと要約

本稿では、手に持ったカメラを用いて、制約のない屋外環境における最も歩きやすい方向をリアルタイムで特定するシステムを提案する。独自に開発した高速かつ高精度なセマンティックセグメンテーションネットワークと、空間的・時間的グラフモデリングを活用し、物体の属性にわたるコスト関数を学習する。本手法は、安全なナビゲーション方向を予測する際、84%の正確性を達成し、PASCAL VOCとPASCAL ContextでそれぞれmIOUが81および44.7を記録する。また、約21 FPSで動作する。

ABSTRACT

We present an approach for identifying the most walkable direction for navigation using a hand-held camera. Our approach extracts semantically rich contextual information from the scene using a custom encoder-decoder architecture for semantic segmentation and models the spatial and temporal behavior of objects in the scene using a spatio-temporal graph. The system learns to minimize a cost function over the spatial and temporal object attributes to identify the most walkable direction. We construct a new annotated navigation dataset collected using a hand-held mobile camera in an unconstrained outdoor environment, which includes challenging settings such as highly dynamic scenes, occlusion between objects, and distortions. Our system achieves an accuracy of 84% on predicting a safe direction. We also show that our custom segmentation network is both fast and accurate, achieving mIOU (mean intersection over union) scores of 81 and 44.7 on the PASCAL VOC and the PASCAL Context datasets, respectively, while running at about 21 frames per second.

研究の動機と目的

  • 視覚に障害を有するユーザーが制約のない屋外環境において、最も歩きやすい方向を特定できるリアルタイムナビゲーションシステムの開発を目的とする。
  • 白杖や屋内センサに依存する従来のシステムでは屋外では効果が薄いという限界を克服することを目的とする。
  • 1人称視点の映像をキャプチャする手に持ったカメラを用いて、複雑な屋外シーンにおいて安全かつ動的なナビゲーションを実現する、頑健なソリューションの構築を目的とする。
  • リアルタイムデプロイメントに適した低遅延を維持しながら高い性能を発揮する、軽量かつ高精度なセマンティックセグメンテーションネットワークの設計を目的とする。
  • 支援技術分野の研究を支援するため、大規模かつ挑戦的なアノテート済みデータセットを構築することを目的とする屋外ナビゲーション用データセットの作成

提案手法

  • 速度と精度に最適化された独自のエンコーダ・デコーダアーキテクチャをセマンティックセグメンテーションに用い、PASCAL VOCでmIOUが81、PASCAL Contextで44.7を達成した。
  • 検出された物体の空間的・時間的挙動をモデル化するため、空間的・時間的グラフを構築した。
  • 物体の空間的(例:距離、位置)および時間的(例:運動、速度)属性にわたるコスト関数を学習し、最も安全な移動可能な方向を特定した。
  • 本システムは、手に持ったカメラからの1人称動画入力を用い、リアルタイムに物体(人や障害物)を検出し追跡する。
  • マルチスケールの残差ブロックを設計することで、文脈情報を効率的に統合し、低深度および低推論速度でも高い性能を発揮するようにした。
  • 標準畳み込みの代替として、ドーナツ型畳み込み(dilated convolutions)を評価した。性能はわずかに低下したが、パラメータ数が削減された。

実験結果

リサーチクエスチョン

  • RQ1手に持ったカメラのみを用いて、制約のない屋外環境で最も歩きやすい方向を特定する方法は何か?
  • RQ2軽量でリアルタイムなセマンティックセグメンテーションモデルは、支援ナビゲーションシステムにおいて低遅延を維持しながら高い正確性を達成できるか?
  • RQ3空間的・時間的モデリングとコスト関数学習は、動的な屋外シーンにおける安全性と適応性をどのように向上させるか?
  • RQ4モバイル支援アプリケーションのセマンティックセグメンテーションにおいて、モデルの深さ、幅、推論速度の間にはどのような性能のトレードオフがあるか?
  • RQ5PASCAL VOC や Cifar といったベンチマークデータセットにおいて、独自アーキテクチャは、既存の最先端モデルを上回る正確性と速度を達成できるか?

主な発見

  • 提案されたシステムは、新たに収集した屋外ナビゲーションデータセットにおいて、最も歩きやすい方向を予測する際、84%の正確性を達成した。
  • 独自のセグメンテーションネットワークは、PASCAL VOCでmIOUが81、PASCAL Contextで44.7を記録し、同程度の深さの多くの既存モデルを上回った。
  • システムは約21フレーム/秒で動作し、モバイルデプロイメントに適したリアルタイム性能を示した。
  • 深さ38のネットワークでは、Cifar-10でトップ5誤差率が4.99%を記録し、はるかに深いResNet-1001(4.92%)と同等の性能を発揮したが、パラメータ数は著しく少なかった。
  • ドーナツ型畳み込みはパラメータ数を削減したが、標準畳み込みと比較して1.47%高い誤差率(深さ38のCifar-10)を示した。
  • 本手法は動的なシーンに適応できた:初期には遠くの物体を最も安全と判断したが、運動パターンの変化を受けて、後続では地面に近い物体に更新され、より安全で安定した選択となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。