Skip to main content
QUICK REVIEW

[논문 리뷰] PDDLGym: Gym Environments from PDDL Problems

Tom Silver, Rohan Chitnis|arXiv (Cornell University)|2020. 02. 15.
Software Engineering Research참고 문헌 25인용 수 10
한 줄 요약

PDDLGym은 PDDL 도메인 및 문제 파일에서 자동으로 OpenAI Gym 환경을 생성하는 오픈소스 프레임워크로, 관계형 강화학습 및 순차적 의사결정 연구를 가능하게 한다. 다양한 커스터마이징 가능한 벤치마크를 지원하며, 소코반에서 TSP에 이르기까지 다양한 환경을 내장하고 있어 계획 수립 및 모델 학습의 어려움에 큰 변동성을 보인다.

ABSTRACT

We present PDDLGym, a framework that automatically constructs OpenAI Gym environments from PDDL domains and problems. Observations and actions in PDDLGym are relational, making the framework particularly well-suited for research in relational reinforcement learning and relational sequential decision-making. PDDLGym is also useful as a generic framework for rapidly building numerous, diverse benchmarks from a concise and familiar specification language. We discuss design decisions and implementation details, and also illustrate empirical variations between the 20 built-in environments in terms of planning and model-learning difficulty. We hope that PDDLGym will facilitate bridge-building between the reinforcement learning community (from which Gym emerged) and the AI planning community (which produced PDDL). We look forward to gathering feedback from all those interested and expanding the set of available environments and features accordingly. Code: https://github.com/tomsilver/pddlgym

연구 동기 및 목표

  • Gym과 PDDL를 통합하여 강화학습(RL)과 전통적 AI 계획 간 격차를 해소한다.
  • 표준화되고 상징적인 명세 언어를 사용하여 연구자들이 관계형 순차적 의사결정을 위한 빠르고 비교 가능한 벤치마크를 생성할 수 있도록 한다.
  • RL 및 계획 연구자들이 동일하고 명확하게 정의된 환경에서 방법을 평가할 수 있도록 하여 다학제적 연구를 촉진한다.
  • 통합적이고 확장 가능한 프레임워크를 통해 관계형 RL, 계층적 정책 학습, 상태 추상화 분야의 고급 연구를 지원한다.
  • 상호작용 데이터로부터 상징적 전이 모델을 학습하고 관계 구조를 탐색하는 데 기반을 제공한다.

제안 방법

  • PDDL 도메인 및 문제 파일을 기반으로 파이썬 라이브러리를 사용해 자동으로 Gym 환경을 생성한다.
  • 관측을 기반 관계 술어의 집합(예: on(plate, table))으로 표현하고, 행동을 구체화된 연산자 템플릿(예: pick(plate))으로 표현한다.
  • 환경 측면에서 PDDL로 정의된 전이 모델을 기반으로 Gym의 표준 API(기능: step, reset, action_space, observation_space)를 구현한다.
  • 20개의 내장 도메인 중 11개에 대해 커스터마이징된 렲시를 지원하여 시각화 및 해석 가능성 향상.
  • 각 환경에서 계획 및 모델 학습의 어려움을 평가하기 위해 Fast-Forward 계획 및 FOLDT 학습을 사용한다.
  • URL 기반 로딩을 통해 외부 PDDL 리포지터리와의 통합을 지원하여 확장성 및 커뮤니티 기여를 가능하게 한다.

실험 결과

연구 질문

  • RQ1어떻게 하면 PDDL 기반의 계획 문제를 강화학습 연구를 위한 표준화된 Gym 환경으로 체계적으로 변환할 수 있는가?
  • RQ2PDDL 기반 환경은 계획의 어려움과 모델 학습 복잡성 측면에서 얼마나 다양하게 변동하는가?
  • RQ3PDDLGym은 관계형 RL과 상징적 계획 분야의 연구를 통합하고 가속화하기 위한 공통의 벤치마크 플랫폼으로 기능할 수 있는가?
  • RQ4관계형 환경에서 상호작용 데이터로부터 정확한 전이 모델을 학습하는 데 있어 어떤 과제가 존재하는가?
  • RQ5PDDLGym은 계층적, 목표 조건화, 업그레이드된 정책 학습 방법의 개발을 어떻게 지원할 수 있는가?

주요 결과

  • 내장된 20개의 PDDLGym 환경은 계획의 어려움에 있어 상당한 변동성을 보이며, Depot 도메인은 TSP 도메인보다 시간이 약 두 배수 더 소요된다.
  • Fast-Forward 계획 시간은 TSP의 경우 1초 미만에서 Depot의 경우 1000초 이상으로 다양하게 나타나 문제의 복잡성 스펙트럼이 넓음을 시사한다.
  • 모델 학습의 어려움은 크게 다양하게 나타났다: FOLDT 학습은 5개의 도메인에서 성공했지만, Baking, Depot, Sokoban와 같은 도메인에서는 합리적인 시간 내에 수렴하지 못했다.
  • 환경 전반의 평균 프레임 수는 Sokoban의 155에서 TSP의 1688에 이르기까지 다양하게 나타나 무작위 정책 하에서 성능의 변동성을 보였다.
  • 20개의 도메인 중 11개에 대해 커스터마이징된 렌더링을 구현하여 연구 및 디버깅에 있어 시각화 및 이해도를 향상시켰다.
  • 실험 결과는 심지어 TSP나 Blocks와 같은 '간단한' 도메인이라도 연산자 발견 및 상태 추상화와 같은 비트리비얼한 과제를 제기함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.