Skip to main content
QUICK REVIEW

[논문 리뷰] Compositional Reinforcement Learning from Logical Specifications

Kishor Jothimurugan, Suguman Bansal|arXiv (Cornell University)|2021. 06. 25.
Reinforcement Learning in Robotics참고 문헌 37인용 수 10
한 줄 요약

이 논문은 복잡한 논리적 명세로부터 제어 정책을 학습하기 위해 모델기반 고수준 계획과 모델자유형 딥 강화학습을 조합하는 구성적 강화학습 프레임워크인 DiRL을 제안한다. 명세를 추상적 그래프로 인코딩하고, Dijkstra 스타일의 계획을 사용해 하위작업에 대한 실시간 정책 학습을 이끌어내어, 선형 표본 복잡도 스케일링을 달성하고 장수평선 작업을 포함한 연속 제어 벤치마크에서 최신 기준 성능을 초월한다.

ABSTRACT

We study the problem of learning control policies for complex tasks given by logical specifications. Recent approaches automatically generate a reward function from a given specification and use a suitable reinforcement learning algorithm to learn a policy that maximizes the expected reward. These approaches, however, scale poorly to complex tasks that require high-level planning. In this work, we develop a compositional learning approach, called DiRL, that interleaves high-level planning and reinforcement learning. First, DiRL encodes the specification as an abstract graph; intuitively, vertices and edges of the graph correspond to regions of the state space and simpler sub-tasks, respectively. Our approach then incorporates reinforcement learning to learn neural network policies for each edge (sub-task) within a Dijkstra-style planning algorithm to compute a high-level plan in the graph. An evaluation of the proposed approach on a set of challenging control benchmarks with continuous state and action spaces demonstrates that it outperforms state-of-the-art baselines.

연구 동기 및 목표

  • 복잡하고 장수평선 작업을 고수준 논리 언어로 기술된 제어 정책을 학습하는 데 도전하는 것.
  • 복잡한 작업 조합을 다룰 때 기존 보상함수 기반 강화학습 방법의 열악한 확장성 문제를 해결하는 것.
  • 명세의 구조적 분해를 활용하여 고수준 계획과 저수준 정책 학습을 분리하는 방법을 개발하는 것.
  • 복잡한 명세를 가진 연속 제어 환경에서 표본 효율성과 성공률을 향상시키는 것.
  • 복잡한 논리적 목표에 대해 높은 만족 확률을 유지하면서도 확장 가능한 구성적 정책 학습을 가능하게 하는 것.

제안 방법

  • 논리적 명세를 정점이 상태 영역을 나타내고 간선이 하위작업을 나타내는 추상적 그래프로 변환한다.
  • 명세의 만족 확률을 최대화하는 고수준 계획을 계산하기 위해 Dijkstra 스타일의 전진 탐색을 사용한다.
  • 경로 상의 각 하위작업에 대해, 필요할 때만 실시간으로 모델자유형 강화학습을 통해 신경망 정책을 학습한다.
  • 계획 및 정책 학습 과정을 통해 명세의 만족 확률에 하한을 유지한다.
  • 학습된 경로 정책를 사용해 하위목표 영역에서 실시간으로 샘플링하여, 하위목표 영역의 어떤 상태에서도 궤적 생성을 가능하게 한다.
  • 프레임워크는 명세 그래프의 크기와 선형적으로 확장되도록 설계되어 있어, 종단간 강화학습 대비 표본 복잡도를 감소시킨다.

실험 결과

연구 질문

  • RQ1고수준 계획과 수요에 따라 발생하는 저수준 정책 학습을 번갈아 적용하는 구성적 강화학습 프레임워크가 복잡한 논리적 명세에서 종단간 강화학습보다 더 뛰어난 표본 효율성을 달성할 수 있는가?
  • RQ2논리적 명세의 구조적 분해를 활용하면 명세 크기와 비례하여 표본 복잡도가 선형적으로 증가하는가?
  • RQ3이러한 프레임워크는 Spectrl, Tltl, Qrm, Hrm, R-avi와 같은 최신 기준 방법보다 장수평선 연속 제어 작업에서 승리할 수 있는가?
  • RQ4고차원 상태 공간과 복잡한 제약 조건을 가진 환경, 예를 들어 Fetch 로봇 암 환경에서 이 방법은 얼마나 효과적인가?
  • RQ5하위목표 영역이 부분적으로 차단되거나 접근성이 떨어질 경우, 이 방법은 어느 정도 강건성을 유지하는가?

주요 결과

  • DiRL은 9-Rooms 및 Fetch 환경에서 모두 최신 기준 방법인 Spectrl, Tltl, Qrm, Hrm, R-avi보다 학습 성공 확률에서 뚜렷한 승리를 거두었다.
  • DiRL의 표본 복잡도는 명세 그래프의 간선 수에 대해 거의 선형적으로 증가하여, 작업 복잡도 증가에 따라 효율적인 확장성을 보였다.
  • 9-Rooms 환경에서, 하위작업 수가 증가할수록 모든 기준 방법보다 DiRL이 더 빨리 높은 성공 확률을 달성했다.
  • 고차원 상태 공간을 가진 도전적인 Fetch 환경에서, 조건부 및 순차적 하위목표를 포함한 복잡한 작업에 대해서도 DiRL은 효과적인 정책을 학습했다.
  • 차단된 문이나 접근성 저하가 발생하는 환경에서도 DiRL은 다양한 명세에서 높은 성능을 유지하며 강건성을 보였다.
  • 실험 결과에 따르면, DiRL의 성공 확률은 기준 방법보다 더 빠르게 수렴하고 더 높은 수준에 도달했으며, 학습 곡선은 안정적이고 확장 가능한 학습을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.