Skip to main content
QUICK REVIEW

[論文レビュー] UAV Visual Teach and Repeat Using Only Semantic Object Features

Amirmasoud Ghasemi Toudeshki, Faraz Shamshirdar|arXiv (Cornell University)|Jan 24, 2018
Robotics and Sensor-Based Localization参考文献 21被引用数 8
ひとこと要約

本論文では、低レベルの画像特徴に依存せず、深層畳み込みニューラルネットワーク(CNN)に基づくセマンティックオブジェクト検出結果のみをランドマークとして用いる、単眼ドローンVTR(Visual Teach and Repeat)システムを提案する。本手法は、セマンティック検出器の不変性を活用することで、大きな視点変化、照明の変化、オブジェクトの移動に対しても、再局在化と軌道再現が安定して実現され、教示開始点から5m離れた位置にあり、任意の向きを向いた状態からでも、40%の高度変化やオブジェクトの削除・移動が生じる状況下でも、軌道を正常に完了する。

ABSTRACT

We demonstrate the use of semantic object detections as robust features for Visual Teach and Repeat (VTR). Recent CNN-based object detectors are able to reliably detect objects of tens or hundreds of categories in a video at frame rates. We show that such detections are repeatable enough to use as landmarks for VTR, without any low-level image features. Since object detections are highly invariant to lighting and surface appearance changes, our VTR can cope with global lighting changes and local movements of the landmark objects. In the teaching phase, we build a series of compact scene descriptors: a list of detected object labels and their image-plane locations. In the repeating phase, we use Seq-SLAM-like relocalization to identify the most similar learned scene, then use a motion control algorithm based on the funnel lane theory to navigate the robot along the previously piloted trajectory. We evaluate the method on a commodity UAV, examining the robustness of the algorithm to new viewpoints, lighting conditions, and movements of landmark objects. The results suggest that semantic object features could be useful due to their invariance to superficial appearance changes compared to low-level image features.

研究の動機と目的

  • 単一のセマンティックオブジェクト検出結果のみをランドマークとして用いる、ドローン向けに頑健なVisual Teach and Repeat(VTR)システムの開発。
  • 視点や照明の変化に敏感な低レベル特徴(例:SIFT、SURF)の限界を解消すること。
  • オブジェクト移動や照明の変化といった動的変化を伴う実世界環境において、信頼性の高い再局在化と軌道再現を実現すること。
  • 大規模な視点変化や環境的擾乱を伴う条件下で、一般ドローンを用いて本手法の評価を行うこと。
  • 屋外および屋内環境における長期的・インfrastrucureフリーなナビゲーションに、セマンティック特徴が実現可能かどうかを検討すること。

提案手法

  • 教示段階では、事前学習済みのCNNオブジェクト検出器を用いて、検出されたオブジェクトラベルとその2次元画像平面上の位置からなる、コンactなシーン記述子を記録する。
  • 再現段階では、Seq-SLAMにインspiredされた時系列的再局在化手法を用い、現在のオブジェクト検出シーケンスを学習済みシーケンスと照合することで、最も類似した参照シーンを特定する。
  • ファンネルレーンベースのビジュアルサーボ制御器が、以前に飛行された軌道に従ってドローンを誘導する。2ウィンドウの先読み機構により、近い将来のランドマークへの対応を向上させる。
  • 本システムは、低レベル特徴や3次元再構築を一切使用しない。これにより、計算効率が向上し、外観の変化に対しても頑健性が確保される。
  • オブジェクト検出は、動画フレームレートでリアルタイムに実行可能であり、動的かつスケーラブルなランドマーク追跡を可能にする。
  • 本手法は、照明の変化やオブジェクトの削除・移動といった制御された環境変更を伴う実世界実験を通じて、一般ドローンを用いて評価された。

実験結果

リサーチクエスチョン

  • RQ1セマンティックオブジェクト検出結果のみで、単眼ドローンVTRのための十分で再現可能なランドマークを提供できるか?
  • RQ2軌道再現中に、大きな視点変化、照明の変化、オブジェクトの移動(例:削除や再配置)に対して、本システムはどの程度頑健か?
  • RQ3教示位置から5m離れており、任意の向きを向いた状態から開始した場合でも、本システムは再局在化を行い、軌道を正常に再現できるか?
  • RQ4類似した環境的擾乱条件下で、本手法のセマンティックベースVTRの性能は、従来の特徴ベース手法(例:SURF)と比べてどうか?
  • RQ5再現中にドローンの高度を40%変更した場合でも、本システムは軌道追従を維持できるか?

主な発見

  • 教示位置から5m離れており、任意の向きを向いた状態からでも、ドローンは正常に再局在化し、軌道を完了した。これは、従来のSURFベース手法が1mを超えるずれでは失敗するのに対し、本手法が優れた性能を示したことを示している。
  • ドローンの高度を40%増加させた場合でも、本システムは信頼性の高い性能を維持した。これは、スケールおよび視点変化に対する頑健性を示している。
  • オブジェクトが削除または移動した場合、平均して4秒の軌道完了時間の増加が生じた。これは、不一致したランドマークの整合性による制御器の性能劣化が原因である。
  • 驚くべきことに、グローバルな照明の変更(例:天井照明の消灯とスポットライトの使用)により、検出の一貫性が向上し、「フレイクイング(チラツキ)」検出が減少したため、完了時間が短縮された。
  • オブジェクトの削除・移動時には検出特徴数が減少したが、それでも正常な再局在化とナビゲーションに十分な数の特徴が維持された。
  • 本手法は、オブジェクトの回転や同種の別のオブジェクトへの交換に対しても強い不変性を示した。これは、セマンティック特徴が長期的VTRに有効であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。