Skip to main content
QUICK REVIEW

[논문 리뷰] Continuous Motion Planning with Temporal Logic Specifications using Deep Neural Networks

Chuanzheng Wang, Yinan Li|arXiv (Cornell University)|2020. 04. 02.
Reinforcement Learning in Robotics참고 문헌 29인용 수 8
한 줄 요약

이 논문은 연속적인 운동 계획을 위한 딥 강화학습 방법을 제안하며, 선형 시간 논리(LTL) 사양을 사용하기 위해 주석이 달린 한정 결정성 비우 애너레이터(LDBA)를 도입하여 조밀한 보상 형태를 가능하게 한다. 각 학습 에피소드의 시작 시에 자동화 상태를 무작위로 샘플링함으로써 초기 상태에 고정하는 것보다 표본 효율성과 성공률을 크게 향상시켰으며, 시뮬레이션에서 차량형 로봇을 대상으로 한 복잡한 LTL 작업에서 63.3%의 성공률을 기록하였다.

ABSTRACT

In this paper, we propose a model-free reinforcement learning method to synthesize control policies for motion planning problems with continuous states and actions. The robot is modelled as a labeled discrete-time Markov decision process (MDP) with continuous state and action spaces. Linear temporal logics (LTL) are used to specify high-level tasks. We then train deep neural networks to approximate the value function and policy using an actor-critic reinforcement learning method. The LTL specification is converted into an annotated limit-deterministic Büchi automaton (LDBA) for continuously shaping the reward so that dense rewards are available during training. A naïve way of solving a motion planning problem with LTL specifications using reinforcement learning is to sample a trajectory and then assign a high reward for training if the trajectory satisfies the entire LTL formula. However, the sampling complexity needed to find such a trajectory is too high when we have a complex LTL formula for continuous state and action spaces. As a result, it is very unlikely that we get enough reward for training if all sample trajectories start from the initial state in the automata. In this paper, we propose a method that samples not only an initial state from the state space, but also an arbitrary state in the automata at the beginning of each training episode. We test our algorithm in simulation using a car-like robot and find out that our method can learn policies for different working configurations and LTL specifications successfully.

연구 동기 및 목표

  • 복잡한 LTL 사양을 가진 연속적인 운동 계획을 위한 딥 강화학습 에이전트 학습에서 희박한 보상 문제를 해결한다.
  • 최종 보상에 의존하는 표준 RL 방법의 한계를 극복하여 고차원적이고 연속적인 제어 문제에서 낮은 표본 효율성을 초래한다.
  • 에피소드 초기화 시 자동화 상태 샘플링을 통해 연속적인 보상 신호를 제공함으로써 학습 안정성과 수렴성을 향상시킨다.
  • 딥 디터민리스틱 정책 그라디언트(DDPG)와 LDBA 주석 보상 형태를 결합하여 비선형 로봇 모델에 대해 복잡한 시간 논리 제약 조건 하에서 효과적인 정책 학습을 가능하게 한다.
  • 비볼록적이고 제약이 있는 환경을 포함한 다양한 초기 상태와 LTL 사양에서의 시뮬레이션을 통해 강인성을 입증한다.

제안 방법

  • 주어진 LTL 사양을 주석이 달린 한정 결정성 비우 애너레이터(LDBA)로 변환하여 수용 조건을 인코딩하고 연속적인 보상 형태를 가능하게 한다.
  • 각 에피소드의 시작 시에 로봇의 초기 상태와 LDBA의 무작위 상태를 모두 샘플링하는 새로운 학습 기법을 도입하며, 자동화의 초기 상태에 고정하는 것과는 달리 수행한다.
  • LDBA 상태를 사용하여 단계별로 LTL 공식을 만족시키는 데 도움이 되는 조밀하고 상태 기반의 보상 함수를 정의한다.
  • 고차원 상태 및 행동 공간에서 연속 제어 정책을 학습하기 위해 별도의 액터 및 크리틱 신경망을 사용하는 딥 디터민리스틱 정책 그라디언트(DDPG) 알고리즘을 적용한다.
  • 로봇 동역학과 LDBA의 프로덕트 MDP를 하나의 환경으로 통합하여, 크리틱이 상태-행동 가치를 추정하고 액터가 정책 그라디언트 업데이트를 통해 정책을 향상시킨다.
  • 진전을 위한 음수의 조밀한 보상, 목표 영역에 도달했을 때의 양수 보상, 제약 위반(예: 특정 상태에 도달한 후 금지 영역 진입)에 대한 벌점을 포함하는 보상 함수를 사용한다.

실험 결과

연구 질문

  • RQ1주석이 달린 LDBA를 통한 조밀한 보상 형태가 LTL 사양이 있는 연속적인 운동 계획을 위한 딥 강화학습에서 표본 효율성을 향상시키는가?
  • RQ2에피소드 시작 시 자동화 상태를 무작위로 샘플링하는 것이 자동화의 초기 상태에 고정하는 것보다 학습 성능을 향상시키는가?
  • RQ3제안된 방법은 논리적 논리합, 시간 순서, 제약 조건(예: 특정 사건 이후 영역 회피)을 포함한 복잡한 LTL 공식에 대해 정책을 성공적으로 학습할 수 있는가?
  • RQ4비볼록 장애물 구성과 다수의 초기 상태에서 시뮬레이션 환경에서 이 방법의 성능은 어떠한가?
  • RQ5재학습 없이 다양한 작업 구성과 LTL 사양에 대해 이 방법이 얼마나 일반화되는가?

주요 결과

  • 예제 2에서 제안된 방법은 30개의 초기 상태에서 표준 방법 대비 63.3%의 성공률을 기록했으며, 표준 방법은 13.3%에 그쳤다. 이는 표본 효율성 향상의 뚜렷한 증거이다.
  • 예제 3에서 사례 1에서는 63.3%의 성공률, 사례 2에서는 60%의 성공률을 기록했으며, 표준 방법은 각각 10%와 6.7%였다. 특히 비선형 영역 둘레나 복잡한 제약 조건이 존재하는 상황에서도 성능이 뛰어났다.
  • LTL 공식에 따라 금지 영역(예: 영역 c)을 회피해야 할 경우, 예를 들어 영역 b에 먼저 도달한 후에 영역 c를 피해야 할 경우, 자동화를 통해 정확한 논리적 추론을 수행하며 이를 성공적으로 학습했다.
  • 에이전트는 초기 위치에 따라 최적의 경로를 동적으로 선택할 수 있었으며, 예를 들어 영역 b가 금지 영역으로 이어질 경우 영역 a를 선택함으로써 적응형 의사결정을 보였다.
  • 에피소드 시작 시 자동화 상태를 무작위로 샘플링하는 방식이 복잡한 LTL 공식(다중 분岐 및 시간 의존성 포함)에서 학습 안정성과 수렴성을 크게 향상시켰다.
  • 시뮬레이션 결과는 이 방법이 다양한 초기 위치와 LTL 사양에 대해 잘 일반화되며, 비선형 차량형 로봇 동역학에서도 유효한 궤적을 성공적으로 생성함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.