Skip to main content
QUICK REVIEW

[논문 리뷰] Stochastic Finite State Control of POMDPs with LTL Specifications

Mohamadreza Ahmadi, Rangoli Sharan|arXiv (Cornell University)|2020. 01. 21.
Advanced Control Systems Optimization참고 문헌 33인용 수 12
한 줄 요약

이 논문은 선형 시간 논리(LTL) 사양을 가진 부분적으로 관찰 가능한 마르코프 결정 과정(POMDPs)에 대해 유한 상태 제어기를 합성하기 위해 확률적 유계 정책 반복 알고리즘을 제안한다. 이 알고리즘은 만족 확률을 최대화하며, 포isson 방정식과 McCormick 봉우리를 활용하여 볼록화를 실시함으로써, 제어기 복잡도가 제어 가능하게 증가하는 anytime, 확장 가능한 제어 합성 기법을 제공한다.

ABSTRACT

Partially observable Markov decision processes (POMDPs) provide a modeling framework for autonomous decision making under uncertainty and imperfect sensing, e.g. robot manipulation and self-driving cars. However, optimal control of POMDPs is notoriously intractable. This paper considers the quantitative problem of synthesizing sub-optimal stochastic finite state controllers (sFSCs) for POMDPs such that the probability of satisfying a set of high-level specifications in terms of linear temporal logic (LTL) formulae is maximized. We begin by casting the latter problem into an optimization and use relaxations based on the Poisson equation and McCormick envelopes. Then, we propose an stochastic bounded policy iteration algorithm, leading to a controlled growth in sFSC size and an any time algorithm, where the performance of the controller improves with successive iterations, but can be stopped by the user based on time or memory considerations. We illustrate the proposed method by a robot navigation case study.

연구 동기 및 목표

  • 최적 제어가 비가역적인 상황에서, LTL 사양을 가진 POMDPs에 대해 부분 최적의 확률적 유한 상태 제어기(sFSCs)를 합성하는 문제에 대응한다.
  • 로봇 주행 및 자율 시스템과 같은 부분 관찰 가능하고 불확실한 환경에서 복잡한 고수준 LTL 사양을 만족할 확률을 최대화한다.
  • 시간 또는 메모리 제약 조건에 따라 사용자가 정의한 정지 조건을 허용하면서 성능을 반복적으로 향상시킬 수 있는 확장 가능하고 anytime인 알고리즘을 개발한다.
  • LTL 하에서 최적 POMDP 제어의 비가역성을 해결하기 위해 볼록화 및 제어 가능한 상태 증가를 수반하는 유계 정책 반복을 사용한다.
  • 초기 타당한 제어기 생성 및 sFSC에 상태 동적 추가를 통해 보수성(conservatism)을 완화함으로써 실용성을 확보한다.

제안 방법

  • LTL 사양을 결정성 라빈 옴니어터(기계)로 표현한 후, 시스템과 사양의 공동 역학을 인코딩하기 위해 제품-POMDP를 구성한다.
  • 제어기의 자유 매개변수에 대한 최적화 문제로 sFSC 설계를 공식화하며, LTL 만족 확률을 최대화하고자 한다.
  • 제품-POMDP에서의 기대 보상 재구성에 포isson 방정식을 적용하여, 동적 프rogramming 기법의 적용을 가능하게 한다.
  • 최적화 과정에서 발생하는 이차항을 볼록화하기 위해 McCormick 봉우리를 사용하여 비볼록 제약 조건을 볼록 근사로 변환한다.
  • 특정 부분집합(G^ss)에만 상태를 추가함으로써 제어 가능한 성장률을 보장하는 확률적 유계 정책 반복(BPI) 알고리즘을 구현한다.
  • 수정된 보상 함수와 제품 마르코프 체인 내 흡수 상태를 통해 특정 상태를 회피하는 제약 조건을 강제로 적용함으로써, 최적화 과정 중 정확성을 유지한다.

실험 결과

연구 질문

  • RQ1POMDPs에 대해 LTL 사양을 만족할 확률을 최대화하기 위해 부분 최적의 확률적 유한 상태 제어기(sFSCs)를 어떻게 합성할 수 있는가?
  • RQ2시간 또는 메모리 제약 조건에 따라 사용자가 정의한 정지 조건을 허용하면서 성능 향상이 지속적으로 이루어지는 확장 가능하고 anytime인 알고리즘을 어떻게 설계할 수 있는가?
  • RQ3제어기 매개변수화 과정에서 발생하는 이차항으로 인해 비볼록화된 최적화 문제를 다루기 위해 어떤 볼록화 기법을 사용할 수 있는가?
  • RQ4유계 정책 반복을 어떻게 적응시켜 sFSC 크기의 제어 가능한 증가를 보장하면서도 LTL 만족 확률을 유지하거나 향상시킬 수 있는가?
  • RQ5특히 초기 타당한 제어기 생성 및 상태 추가 단계에서 보수성을 완화하기 위한 전략은 무엇인가?

주요 결과

  • 제안된 확률적 유계 정책 반복 알고리즘은 sFSC 크기의 제어 가능한 증가를 가능하게 하여, 계산 자원 제약 조건에 따라 언제든지 프로세스를 중단할 수 있도록 한다.
  • 그림 5에 나타낸 바와 같이, 제품-POMDP에서 목표 집합 $Repeat_{0}^{ ext{PM}^{ Varepsilon}}$ 의 평균 방문 빈도가 단조롭게 향상됨을 확인하여, LTL 만족 확률 향상이 이루어짐을 입증한다.
  • 포isson 방정식과 McCormick 봉우리의 사용으로 비볼록 최적화 문제가 성공적으로 볼록화되었으며, 이로 인해 제어 가능한 정책 반복 기반의 효율적이고 확장 가능한 해법이 가능해졌다.
  • 흡수 상태와 보상 기반 제약 조건을 통해 특정 상태(예: $Avoid_{ rak{r}}^{ Varepsilon}$)가 절대 방문되지 않도록 강제함으로써, 알고리즘이 정확성을 유지한다.
  • 기존에 EXPTIME-완전 문제로 간주되던 POMDPs에 대한 유한 기억 전략 합성 문제에 대해, 보장된 수렴을 보장하는 실용적인 해법을 제공한다.
  • 로봇 주행 사례 연구를 통해, sFSC에 상태가 추가될수록 LTL 만족 확률이 측정 가능한 정도로 향상됨을 입증하며, 실제 환경에서의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.