Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Track Dynamic Targets in Partially Known Environments

Heejin Jeong, Hamed Hassani|arXiv (Cornell University)|Jun 17, 2020
Machine Learning and Algorithms参考文献 48被引用数 8
ひとこと要約

本論文は、部分的に既知の環境におけるアクティブターゲットトラッキングのための統合的深層強化学習方策、Active Tracking Target Network (ATTON) を提案する。相互情報量に基づく情報理論的報酬を用いて問題をMDPとして定式化することで、ATTONは視界内トラッキング、ナビゲーション、探索を統合的に学習する。初期信念やターゲットダイナミクスの不確実性がある中でも、俊敏で異常な、または正確にモデル化されていないターゲットを、従来の探索ベースの手法よりも優れた性能でトラッキングする。

ABSTRACT

We solve active target tracking, one of the essential tasks in autonomous systems, using a deep reinforcement learning (RL) approach. In this problem, an autonomous agent is tasked with acquiring information about targets of interests using its onboard sensors. The classical challenges in this problem are system model dependence and the difficulty of computing information-theoretic cost functions for a long planning horizon. RL provides solutions for these challenges as the length of its effective planning horizon does not affect the computational complexity, and it drops the strong dependency of an algorithm on system models. In particular, we introduce Active Tracking Target Network (ATTN), a unified RL policy that is capable of solving major sub-tasks of active target tracking -- in-sight tracking, navigation, and exploration. The policy shows robust behavior for tracking agile and anomalous targets with a partially known target model. Additionally, the same policy is able to navigate in obstacle environments to reach distant targets as well as explore the environment when targets are positioned in unexpected locations.

研究の動機と目的

  • 長期間の計画ホライズンにおいて高い計算複雑性を示す、正確なシステムモデルに大きく依存する従来のアクティブターゲットトラッキング手法の限界を克服する。
  • ターゲットモデルや初期信念が不正確な場合の、短視眼的計画と性能の低下という課題を克服する。
  • ターゲットが予測不能に動くか、初期位置が誤って特定される可能性がある、部分的にしか知られていない環境でも、ロバストなターゲットトラッキングを可能にする。
  • 視界内トラッキング、障害物を避けたナビゲーション、未知のターゲット位置の探索を統合的に処理できる、単一の統合的RLポリシーを開発する。
  • 正確なシステムモデルへの依存を減らし、不確実なターゲットダイナミクスや不完全な事前知識に一般化できるポリシーを学習する。

提案手法

  • アクティブターゲットトラッキングを、将来のターゲット状態と測定履歴の間の相互情報量の割合割合を報酬関数とするMDPとして定式化する。
  • カルマンフィルタを用いて維持される信念状態を、ターゲット位置とダイナミクスの不確実性を表すRL状態に組み込む。
  • エゴセントリックセンサービューと訪問頻度マップを入力画像として用い、異なる訓練環境間での一般化を可能にする。
  • エージェントの位置、信念状態、視覚的観測を含む状態を用いて、深層Qネットワークポリシーをエンドツーエンドで深層強化学習により訓練する。
  • 地図情報と訪問頻度を組み込み、未スキャン領域の探索を促進し、効率的なナビゲーションを実現する。
  • 情報量の増加を促進する報酬関数を用い、明示的な計画ホライズンに依存しない、長期間にわたる非短視眼的行動を促進する。

実験結果

リサーチクエスチョン

  • RQ1単一の深層強化学習ポリシーが、アクティブターゲットトラッキングにおいて視界内トラッキング、ナビゲーション、探索を統合的に効果的に処理できるか?
  • RQ2エージェントの信念モデルが真のターゲットダイナミクスと異なる場合のようなモデル不一致の下で、提案されたRLポリシーはどのように性能を示すか?
  • RQ3不正確な初期信念と確率的ターゲット運動が存在する中で、ポリシーはロバストな行動を学習できるか?
  • RQ4トラッキング成功率と効率性の観点から、統合的ポリシーは従来の探索ベースの計画手法を上回るか?
  • RQ5信念状態と訪問頻度マップの使用が、部分的にしか知られていない環境における探索とナビゲーションをどの程度改善するか?

主な発見

  • ATTONポリシーは、ターゲットモデルが信念更新に使われるものと真のモデルと異なる場合でも、ベースラインの探索ベースの計画手法よりも俊敏で異常なターゲットを顕著に優れた性能でトラッキングする。
  • 障害物が多数存在する環境でも、正確な事前知識に依存せずに、遠くのターゲットに到達するロバストなパス計画を実現する。
  • ターゲット位置に関する初期信念が不正確な場合、ベースライン手法が完全に失敗する状況でも、ポリシーは未知領域を探索し、ターゲットを発見する能力を学習する。
  • 非短視眼的かつ情報理論的目的関数のおかげで、確率的ターゲット運動と部分的観測の多様なシナリオにおいても、ポリシーは強い性能を維持する。
  • 訪問頻度マップとエゴセントリック観測の使用により、ポリシーは異なる環境間で一般化でき、特定のレイアウトに過剰適合することを回避する。
  • 情報理論的報酬のおかげで、明示的な探索ボーナスがなくても、不確実性を低減するために未発見領域を訪問するよう自然に促進されるため、効果的な探索が実現される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。