Skip to main content
QUICK REVIEW

[논문 리뷰] Bounded Policy Synthesis for POMDPs with Safe-Reachability Objectives

Yue Wang, Swarat Chaudhuri|arXiv (Cornell University)|2018. 01. 29.
Reinforcement Learning in Robotics참고 문헌 41인용 수 18
한 줄 요약

이 논문은 안전한 도달 목표를 가진 부분 관측 마르코프 결정 과정(POMDPs)을 해결하기 위한 새로운 방법인 유계 정책 합성(Bounded Policy Synthesis, BPS)을 제안한다. BPS는 목표에 도달할 확률을 높이고 안전하지 않은 상태 방문을 최소화함으로써 안전성과 도달 가능성을 보장한다. BPS는 기호적 제약 조건을 사용해 목표 제약이 있는 민감도 공간을 구성하고, 증분 만족 가능성 모듈로 이론(Satisfiability Modulo Theories, SMT) 솔버를 활용해 유효한 정책을 효율적으로 탐색한다. 이로 인해 큰 민감도 공간에서도 SMT 호출 횟수를 최소화하면서 높은 성능을 달성하였으며, 불확실한 장애물이 존재하는 로봇 주행 사례 연구를 통해 이를 입증하였다.

ABSTRACT

Planning robust executions under uncertainty is a fundamental challenge for building autonomous robots. Partially Observable Markov Decision Processes (POMDPs) provide a standard framework for modeling uncertainty in many applications. In this work, we study POMDPs with safe-reachability objectives, which require that with a probability above some threshold, a goal state is eventually reached while keeping the probability of visiting unsafe states below some threshold. This POMDP formulation is different from the traditional POMDP models with optimality objectives and we show that in some cases, POMDPs with safe-reachability objectives can provide a better guarantee of both safety and reachability than the existing POMDP models through an example. A key algorithmic problem for POMDPs is policy synthesis, which requires reasoning over a vast space of beliefs (probability distributions). To address this challenge, we introduce the notion of a goal-constrained belief space, which only contains beliefs reachable from the initial belief under desired executions that can achieve the given safe-reachability objective. Our method compactly represents this space over a bounded horizon using symbolic constraints, and employs an incremental Satisfiability Modulo Theories (SMT) solver to efficiently search for a valid policy over it. We evaluate our method using a case study involving a partially observable robotic domain with uncertain obstacles. The results show that our method can synthesize policies over large belief spaces with a small number of SMT solver calls by focusing on the goal-constrained belief space.

연구 동기 및 목표

  • 기존의 양적 목표로는 충분히 반영되지 않는 명시적 안전성 및 도달 가능성 보장을 갖춘 POMDPs에 대한 정책 합성 문제를 해결하기 위해.
  • 큰 민감도 공간에서 정책 합성의 계산 비용이 과도한 문제를 해결하기 위해, 허용 가능한 실행에서 도달 가능한 민감도에만 집중함으로써.
  • 기호적 제약 조건을 사용해 목표 제약이 있는 민감도 공간을 압축적으로 표현하여 효율적인 추론을 가능하게 하는 스케일러블한 방법을 개발하기 위해.
  • 불확실한 장애물과 유계 수렴 시간이 존재하는 현실적인 로봇 도메인에서 방법을 평가하기 위해.
  • 목표 제약이 있는 민감도 공간에 집중할 경우, 전체 탐색 대비 SMT 솔버 호출 횟수를 극적으로 줄일 수 있는지 입증하기 위해.

제안 방법

  • 안전-도달 목표를 만족하는 실행에서 초기 민감도로부터 도달 가능한 민감도만 포함하는 목표 제약 민감도 공간의 개념을 도입한다.
  • 유계 수렴 시간 동안 유계 모델 체크(Bounded Model Checking, BMC) 원리를 기반으로 유도된 기호적 제약 조건을 사용해 민감도 공간을 압축적으로 표현한다.
  • 목표 제약이 있는 민감도 공간을 효율적으로 탐색하고 정책을 합성하기 위해 증분 만족 가능성 모듈로 이론(Satisfiability Modulo Theories, SMT) 솔버를 활용한다.
  • 각 단계에서 행동과 관측을 인코딩하는 트리 기반 정책 표현을 사용하며, 잘못된 경로를 차단하는 제약 조건을 적용한다.
  • 수렴 시간을 늘릴 때 이전 솔버 상태를 재사용함으로써 성능을 향상시키기 위해 증분 해결 기법을 활용한다.
  • SMT 솔버 내에서 제약 조건 관리를 효율적으로 하기 위해, BMC 스타일 인코딩을 사용해 푸시/푸시 제약 조건을 적용한다.

실험 결과

연구 질문

  • RQ1안전-도달 목표를 가진 POMDPs에 대한 정책 합성 방법이 기존의 양적 수식에 비해 안전성 및 도달 가능성 보장 측면에서 뛰어나게 성능을 발휘할 수 있는가?
  • RQ2기호적 제약 조건을 사용해 목표 제약이 있는 민감도 공간을 압축적으로 표현할 수 있는가?
  • RQ3증분 SMT 해결이 정책 합성에서 솔버 호출 횟수를 크게 줄이고 확장성을 향상시킬 수 있는가?
  • RQ4부분 관측 가능한 로봇 환경에서 장애물 수와 민감도 공간 크기가 증가함에 따라 이 방법은 어떻게 확장되는가?
  • RQ5전체 탐색 대비 목표 제약이 있는 민감도 공간에 집중할 경우, 탐색하는 계획 수가 얼마나 줄어드는가?

주요 결과

  • 이 방법은 약 120회의 SMT 솔버 호출만으로도 24개의 격자 셀과 4개의 장애물이 존재하는 로봇 주행 도메인에서 정책 합성을 성공적으로 수행하였으며, 도달 가능한 민감도 공간의 크기가 약 10^21개에 이르는 상황에서도 가능했다.
  • SMT 솔버에서 증분 해결을 활성화함으로써 합성 시간이 크게 단축되었으며, 이는 수렴 시간 증가 시 이전 솔버 상태를 재사용하는 것이 효과적임을 입증한다.
  • 장애물 수가 증가함에 따라 정책 합성 시간이 지수적으로 증가하며, 이는 정책 트리 크기와 민감도 공간 차원의 증가로 인한 이론적 복잡도 분석과 일치한다.
  • 장애물 수가 증가함에 따라도 확인한 계획 수(즉, SMT 호출 수)는 여전히 작게 유지되어 약 120회 이하였으며, 이는 목표 제약이 있는 민감도 공간이 매우 효과적인 탐색 공간 축소 방법임을 증명한다.
  • 모든 민감도 경로를 탐색하는 난이도 높은 전수 탐색 대비 관련 민감도 경로에만 집중함으로써, 이 방법은 대규모 POMDPs에서도 합성 가능성을 확보한다.
  • 결과적으로 명시적인 불리안 안전성 및 도달 가능성 제약 조건을 처리할 경우, 특정 시나리오에서는 보상 기반 수식에 비해 더 뛰어난 안전성 및 도달 가능성 보장을 달성함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.