Skip to main content
QUICK REVIEW

[論文レビュー] Memoryless Control Design for Persistent Surveillance under Safety Constraints

Eduardo R. Arvelo, Eric Kim|arXiv (Cornell University)|Sep 26, 2012
Reinforcement Learning in Robotics参考文献 12被引用数 9
ひとこと要約

本稿では、安全制約のもとで2次元格子を移動するロボットのための時不変で記憶のない制御方策を設計するための凸最適化ベースの手法を提案する。非禁止状態の恒常的監視を最大化することを目的とし、エントロピー最大化を活用することで、最小限の再帰的クラスを伴い、可能な限り大きな状態集合を恒常的に訪問する制御方策を計算する。これにより、凸プログラミングを用いて最小限のロボット配置で実現可能な制御が可能となる。

ABSTRACT

This paper deals with the design of time-invariant memoryless control policies for robots that move in a finite two- dimensional lattice and are tasked with persistent surveillance of an area in which there are forbidden regions. We model each robot as a controlled Markov chain whose state comprises its position in the lattice and the direction of motion. The goal is to find the minimum number of robots and an associated time-invariant memoryless control policy that guarantees that the largest number of states are persistently surveilled without ever visiting a forbidden state. We propose a design method that relies on a finitely parametrized convex program inspired by entropy maximization principles. Numerical examples are provided.

研究の動機と目的

  • 禁止領域を有する有限な2次元格子内のロボットに対して、時不変で記憶のない制御方策を設計すること。
  • 禁止状態を訪問せずに、恒常的に監視される状態の数を最大化すること。
  • 最大の状態集合を完全カバーするのに必要なロボットの数を最小限に抑えること。
  • 計算制約のある小型ロボットへのスケーラビリティと実装可能性を確保すること。
  • 安全制約および制御制約のもとで最適な恒常的監視を保証する凸最適化フレームワークを提供すること。

提案手法

  • 各ロボットを有限状態空間および制御空間を持つ制御付きマルコフ連鎖としてモデル化し、状態には位置と向きが含まれる。
  • エントロピー最大化に基づく有限パラメータ化された凸計画問題を用いて、状態上の最適定常分布を計算する。
  • 禁止状態を除外する制約を課し、結果の制御方策が記憶のないものでかつ時不変であることを保証する。
  • 凸計画問題の最適解から制御方策を導出し、到達可能で禁止でない状態のサポートを最大化する。
  • 閉ループマルコフ連鎖における再帰的クラスを同定し、必要な最小ロボット数を特定する。
  • 制限分布の形状を調整し、高関心領域を優先するための追加の凸制約を導入する。

実験結果

リサーチクエスチョン

  • RQ12次元格子において、禁止でない状態の最大集合を恒常的に監視するために必要な最小ロボット数は何か?
  • RQ2安全制約を尊重しながら、記憶のない時不変制御方策をどのように設計できるか?
  • RQ3制約のもとで、定常分布のサポートを最大限に保証する制御方策をエントロピー最大化原理を用いて計算できるか?
  • RQ4最適化フレームワークにおいて、凸制約を用いてロボットの運動の極限的挙動をどのように設計できるか?
  • RQ5閉ループマルコフ連鎖における再帰的クラスの数と、必要な最小ロボット数の関係は何か?

主な発見

  • 提案された凸計画問題は、定常分布のサポートを最大化する制御方策を計算し、禁止でない状態の最大集合が恒常的に監視されることを保証する。
  • 必要な最小ロボット数は、計算された方策のもとでの閉ループマルコフ連鎖における再帰的クラスの数に等しい。
  • 解はスケーラブルであり、[8]に示されるような標準的な凸最適化ツールを用いて効率的に解ける。
  • 数値例では、追加制約が適用されていない場合、監視される状態間で定常分布が比較的均等になることが示された。
  • 高関心領域に対する凸制約を追加することで、その領域の訪問頻度が向上し、ターゲット監視優先度が達成された。
  • 任意の初期状態に対して、状態への極限的訪問頻度が、解で定義された定常確率に比例することが保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。