Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning Based Temporal Logic Control with Soft Constraints Using Limit-deterministic Generalized Buchi Automata

Mingyu Cai, Shaoping Xiao|arXiv (Cornell University)|2021. 01. 25.
Reinforcement Learning in Robotics참고 문헌 35인용 수 5
한 줄 요약

이 논문은 불확실한 환경에서 로봇 운동 계획을 위한 제어 정책을 합성하기 위해 한계 결정성 일반화 부치 자동기(LDGBA)를 사용하는 모델-프리 강화 학습 프레임워크를 제안한다. 이는 만족이 불가능한 선형 시간 논리(LTL) 명시사항의 부분 만족을 가능하게 하며, 수렴 보장과 함께 장기적 위반 비용을 최소화한다. 수렴 보장은 수용 조건을 최대화하고 제약 위반을 최소화하는 정책을 확보하며, 수용 가능한 최대 종단 구성요소(AMEC)가 존재하지 않는 경우에도 가능하다.

ABSTRACT

This paper studies the control synthesis of motion planning subject to uncertainties. The uncertainties are considered in robot motions and environment properties, giving rise to the probabilistic labeled Markov decision process (PL-MDP). A Model-Free Reinforcement The learning (RL) method is developed to generate a finite-memory control policy to satisfy high-level tasks expressed in linear temporal logic (LTL) formulas. Due to uncertainties and potentially conflicting tasks, this work focuses on infeasible LTL specifications, where a relaxed LTL constraint is developed to allow the agent to revise its motion plan and take violations of original tasks into account for partial satisfaction. And a novel automaton is developed to improve the density of accepting rewards and enable deterministic policies. We proposed an RL framework with rigorous analysis that is guaranteed to achieve multiple objectives in decreasing order: 1) satisfying the acceptance condition of relaxed product MDP and 2) reducing the violation cost over long-term behaviors. We provide simulation and experimental results to validate the performance.

연구 동기 및 목표

  • 로봇 동역학과 환경 특성에 대한 불확실성에 기인한 운동 계획 과제를 해결하기 위해 확률적 레이블링 마르코프 결정 과정(PL-MDP)으로 모델링한다.
  • 기존 수용 조건 만족이 환경 제약 또는 확률적 금지로 인해 불가능한 경우, 비가능한 LTL 명시사항에 대한 제어 합성을 가능하게 한다.
  • 두 가지 목표를 우선시하는 강화 학습 프레임워크를 개발한다: (1) 완화된 제품 MDP의 수용 조건을 만족시키고, (2) 장기적 위반 비용을 최소화한다.
  • 기존 RL 방법의 한계를 극복하기 위해, 수용 가능한 최대 종단 구성요소(AMEC)의 존재를 전제로 하는 점을 해결한다. 이는 불확실한 환경에서 존재하지 않을 수 있다.
  • 새로운 자동기 구조인 확장된 한계 결정성 일반화 부치 자동기(E-LDGBA)를 통해 계산 복잡도 증가 없이 방문하지 않은 수용 집합을 명시적으로 추적함으로써 보상 조정의 효율성을 높이고, 결정성 정책을 가능하게 한다.

제안 방법

  • 논문은 비가능한 LTL 명시사항을 다루기 위해 부분 만족을 허용하는 완화된 제품 MDP를 도입하여, 표준 제품 MDP를 수정된 구조로 대체함으로써 제약 완화를 가능하게 한다.
  • 자동기 크기 감소와 확장성 향상을 위해 결정성 라빈 자동기(DRA) 대신 한계 결정성 일반화 부치 자동기(LDGBA)를 사용한다. 이는 복잡한 LTL 공식에 특히 유리하다.
  • LDGBA에서 방문하지 않은 수용 집합을 명시적으로 추적할 수 있도록 새로운 확장된 LDGBA(E-LDGBA)를 설계하여, RL 과정에서 보다 효과적인 보상 조정이 가능하도록 한다.
  • 수용 조건 우선 순위와 장기적 위반 비용 최소화를 위해, 수용 집합 방문에 보상을 부여하고 위반에 벌점을 적용하는 유틸리티 함수를 구성한다. 이는 계층적 목표: (1) 수용 조건을 먼저 만족시키고, (2) 이후 위반 비용을 최소화하는 방식이다.
  • 동기식 프론트리 함수를 활용한 모델-프리 RL 프레임워크를 사용하여 보상 설계를 보장함으로써, 에이전트가 완화된 명시사항 하에서 기대 유틸리티를 최대화하는 정책을 학습할 수 있도록 한다.
  • 이론적 분석을 통해 제안된 프레임워크가 AMEC가 존재하지 않는 경우에도, 완화된 제품 MDP의 수용 조건을 만족하고 장기적 위반 비용을 최소화하는 정책으로 수렴함을 보증한다.

실험 결과

연구 질문

  • RQ1제품 MDP에서 수용 가능한 최대 종단 구성요소(AMEC)의 존재를 전제로 하지 않는 한계에서, 불확실한 환경에서 로봇 운동 계획을 위한 제어 정책을 학습하는 강화 학습 프레임워크를 설계할 수 있는가?
  • RQ2환경 제약으로 인해 전체 만족이 확률적으로 불가능한 경우, LTL 명시사항을 원칙적으로 완화하여 부분 만족을 가능하게 할 수 있는 방법은 무엇인가?
  • RQ3한계 결정성 일반화 부치 자동기(LDGBA)를 활용하여 강화 학습 기반의 시간 논리 작업 제어 합성에서 보상 조밀도를 향상시키고 결정성 정책을 가능하게 할 수 있는가?
  • RQ4RL 에이전트가 위반 비용 최소화 이전에 완화된 제품 MDP의 수용 조건을 우선적으로 만족시키도록 보장하는 보상 조정 메커니즘은 무엇인가?
  • RQ5불확실한 환경에서 수용 조건 만족과 장기적 위반 최소화 사이의 최적 균형을 달성하는 정책으로 수렴할 수 있도록 프레임워크가 어떻게 보장할 수 있는가?

주요 결과

  • 제안된 RL 프레임워크는 표준 제품 MDP에서 수용 가능한 최대 종단 구성요소(AMEC)가 존재하지 않는 경우에도, 완화된 제품 MDP의 수용 조건을 만족하는 정책으로 수렴함을 보장한다.
  • E-LDGBA를 통해 방문하지 않은 수용 집합을 추적함으로써 보상 조밀도와 정책의 결정성이 크게 향상되었으며, 이는 더 효과적이고 정확한 보상 신호를 가능하게 하였다.
  • 이론적 분석을 통해, 수용 조건을 만족하지 못하는 정책보다 학습된 정책의 기대 유틸리티가 더 높음을 확인하였으며, 이는 일시적 상태 영역에서도 마찬가지로 성립한다.
  • 시뮬레이션 및 실험 결과를 통해, 불확실한 환경 하에서 복잡한 LTL 작업을 부분적으로 만족시키는 정책을 생성할 수 있음을 검증하였으며, 시간이 지남에 따라 위반 비용이 뚜렷이 감소하는 것으로 나타났다.
  • DRA 대비 LDGBA 사용으로 자동기 크기와 계산 복잡도가 감소하여, 복잡한 LTL 공식에 대한 확장 가능한 합성 구현이 가능해졌다.
  • 기존 RL 방법이 AMEC가 존재하지 않는 경우 실패하는 경우에도 이 프레임워크는 확률적으로 금지된 환경에서 뛰어난 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.