Skip to main content
QUICK REVIEW

[논문 리뷰] Program Synthesis Guided Reinforcement Learning

Yichen Yang, Jeevana Priya Inala|arXiv (Cornell University)|2021. 02. 22.
Reinforcement Learning in Robotics참고 문헌 54인용 수 4
한 줄 요약

이 논문은 장기 시간 간격 제어 작업을 위한 지도 프로그램을 자동으로 생성하기 위해 프로그램 합성 유도 강화 학습 접근법을 제안한다. 모델 예측 프로그램 합성 기법을 사용하여 관측되지 않은 세계 상태의 불확실성을 모델링함으로써 부분 관측 문제를 다룬다. 이 방법은 2D 마인크래프트 유사 캐릭터 세계와 무죠코 앤티 변형과 같은 도전적인 환경에서 완전한 프로그램 지식을 가진 오라클과 유사한 성능을 달성한다.

ABSTRACT

A key challenge for reinforcement learning is solving long-horizon planning and control problems. Recent work has proposed leveraging programs to help guide the learning algorithm in these settings. However, these approaches impose a high manual burden on the user since they must provide a guiding program for every new task they seek to achieve. We propose an approach that leverages program synthesis to automatically generate the guiding program. A key challenge is how to handle partially observable environments. We propose model predictive program synthesis, which trains a generative model to predict the unobserved portions of the world, and then synthesizes a program based on samples from this model in a way that is robust to its uncertainty. We evaluate our approach on a set of challenging benchmarks, including a 2D Minecraft-inspired ``craft'' environment where the agent must perform a complex sequence of subtasks to achieve its goal, a box-world environment that requires abstract reasoning, and a variant of the craft environment where the agent is a MuJoCo Ant. Our approach significantly outperforms several baselines, and performs essentially as well as an oracle that is given an effective program.

연구 동기 및 목표

  • 장기 시간 간격 계획 작업을 위한 강화 학습에서 지도 프로그램을 수동으로 제공하는 부담을 줄이기 위해.
  • 상태 정보가 불완전한 복잡한 환경에서 부분 관측 문제를 해결하기 위해.
  • 관측되지 않은 세계 상태의 불확실성을 모델링하여 강건한 프로그램을 합성하는 방법을 개발하기 위해.
  • 복잡한 서브태스크 순서와 추상적 추론이 필요한 환경에서 접근법을 평가하기 위해.
  • 최적의 지도 프로그램에 접근할 수 있는 오라클의 성능에 가까운 성능을 입증하기 위해.

제안 방법

  • 이 방법은 모델 예측 프로그램 합성을 사용하여, 관측되지 않은 환경 상태의 부분을 예측하는 생성 모델을 훈련한다.
  • 생성 모델에서 샘플링하여 예측된 상태의 불확실성에 강건한 프로그램을 합성한다.
  • 합성된 프로그램을 인덕티브 바이어스로 사용하여 탐색과 정책 학습을 유도함으로써 프로그램 합성과 강화 학습을 통합한다.
  • 상태 예측의 불확실성을 고려하는 계획 기반 메커니즘을 도입하여 부분 관측 환경에서의 일반화 능력을 향상시킨다.
  • 생성 모델과 프로그램 합성기 모두를 함께 최적화하여 작업 성능을 향상시키기 위해 엔드 투 엔드로 훈련한다.
  • 프로그램 생성과 정책 훈련을 유도하기 위해 임의화와 강화 학습 신호의 조합을 사용하여 접근법을 평가한다.

실험 결과

연구 질문

  • RQ1수동으로 지정하지 않고도 프로그램 합성을 활용해 강화 학습을 위한 지도 프로그램을 자동으로 생성할 수 있는가?
  • RQ2부분 관측 환경에서의 불확실성을 효과적으로 모델링하고 프로그램 합성 과정에서 활용할 수 있는가?
  • RQ3자동으로 합성된 프로그램이 오라클 제공 프로그램의 성능에 얼마나 가까이 도달할 수 있는가?
  • RQ4관측 빈도와 작업 복잡도가 다양한 환경에서 이 방법의 확장성은 어떠한가?
  • RQ5불확실성 인식 프로그램 합성의 영향은 장기 시간 간격 작업의 성공률에 어떤가?

주요 결과

  • 제안된 방법은 2D 마인크래프트 유사 캐릭터 세계에서 여러 강력한 베이스라인을 크게 능가하여 더 높은 샘플 효율성과 작업 성공률을 달성했다.
  • 추상적 추론이 필요한 박스 월드 환경에서는 강건한 성능을 보였으며, 이는 복잡한 다단계 추론 작업을 효과적으로 처리했음을 시사한다.
  • 캐릭터 세계의 무죠코 앤티 변형 환경에서, 최적의 지도 프로그램을 제공받은 오라클과 거의 동일한 성능을 달성했다.
  • 모델 예측 프로그램 합성 구성 요소가 상태 불확실성의 영향을 효과적으로 줄여, 부분 관측 환경에서 더 신뢰할 수 있는 정책 학습을 가능케 했다.
  • 다양한 환경에서 강력한 일반화 능력을 보였으며, 테스트한 특정 벤치마크를 넘어선 확장 가능성도 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.