Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Mixed Optimization for Reinforcement Learning with Program Synthesis

Surya Bhupatiraju, Kumar Krishna Agrawal|arXiv (Cornell University)|2018. 07. 01.
Reinforcement Learning in Robotics참고 문헌 13인용 수 3
한 줄 요약

이 논문은 딥 강화학습 정책을 순환적으로 개선하기 위해 블랙박스 정책으로부터 기호적 프로그램을 합성하고, 안전성 및 성능 제약 조건을 위해 수리하며, 다시 신경 정책로 정밀화하는 혼합 최적화 프레임워크인 Morl을 제안한다. 이 방법은 수렴 속도를 높이고 샘플 효율성을 향상시키며, CartPole에서 미세조정 후 평균 수익이 176.8에 도달하는 데 성공했으며, 수정되지 않은 정책의 경우 38.65에 그친다.

ABSTRACT

Deep reinforcement learning has led to several recent breakthroughs, though the learned policies are often based on black-box neural networks. This makes them difficult to interpret and to impose desired specification constraints during learning. We present an iterative framework, MORL, for improving the learned policies using program synthesis. Concretely, we propose to use synthesis techniques to obtain a symbolic representation of the learned policy, which can then be debugged manually or automatically using program repair. After the repair step, we use behavior cloning to obtain the policy corresponding to the repaired program, which is then further improved using gradient descent. This process continues until the learned policy satisfies desired constraints. We instantiate MORL for the simple CartPole problem and show that the programmatic representation allows for high-level modifications that in turn lead to improved learning of the policies.

연구 동기 및 목표

  • 블랙박스 딥 강화학습 정책의 한계를 해결하기 위해, 이는 이해하기 어렵고 디버깅하거나 안전성 보장을 갖춘 제약 조건을 적용하기 어려운 점이다.
  • 기호적 프로그램 합성과 수리를 학습 루프에 통합하여 고수준의 수정을 가능하게 함으로써 정책 학습을 향상시키는 것.
  • 기호적 표현을 활용해 정책 정밀화를 통해 샘플 효율성과 수렴 속도를 향상시키는 것.
  • 재학습 전에 기호적 형태로 정책을 반복적으로 인간 또는 기계 보조 수리할 수 있도록 지원하는 프레임워크를 제공하는 것.
  • 표준 제어 벤치마크인 CartPole에서 이 접근법의 타당성과 이점을 입증하는 것.

제안 방법

  • 도메인 특화 언어(DSL)를 사용하여 훈련된 딥 RL 정책으로부터 기호적 프로그램을 합성하며, Pirl과 Viper의 영감을 받는다.
  • 안전성 또는 행동 개선과 같은 원하는 제약 조건을 충족시키기 위해 기호적 프로그램을 수리한다. 수리는 수동 또는 자동으로 수행될 수 있다.
  • 행동 클론닝(모방 학습)을 사용하여 수정된 기호적 프로그램을 미분 가능 신경 정책으로 정밀화한다.
  • 경사 기반 정책 최적화(예: TRPO)를 적용하여 정밀화된 정책을 추가로 개선한다.
  • 과정을 반복한다: 정책 → 프로그램 → 수리된 프로그램 → 정밀화된 정책 → 향상된 정책, 이로써 폐쇄형 순환 정밀화 루프를 형성한다.
  • 프레임워크를 구현하고 효과를 검증하기 위해 CartPole용 단순 DSL을 사용한다.

실험 결과

연구 질문

  • RQ1딥 RL 정책의 기호적 프로그램 표현이 더 효과적이고 해석 가능한 정책 개선을 가능하게 하는가?
  • RQ2기호 공간에서 정책을 수리하면 이후 훈련에서 더 빠른 수렴과 더 나은 샘플 효율성을 이끌 수 있는가?
  • RQ3프로그램 수리에 포함된 고수준의 인간 제공 인사이트가 열악한 초기화 상태에서 정책 성능을 크게 향상시킬 수 있는가?
  • RQ4프로그램 합성과 수리를 통합한 방식이 표준 엔드 투 엔드 RL에 비해 수렴 속도와 최종 성능 측면에서 어떻게 비교되는가?
  • RQ5기호적 표현이 강화학습에서 검증 가능하고 안전한 정책 학습을 얼마나 잘 지원할 수 있는가?

주요 결과

  • 가장 열악한 초기화 상태의 정책은 25회의 실행에서 평균 수익 9.28을 기록하여 열악한 시작점에서의 열악한 성능을 보였다.
  • 프로그램 수리와 정밀화 후, 중간 정책은 15,000개의 훈련 에포크 후 평균 수익 66을 기록하여 상당한 향상을 보였다.
  • 거의 최적에 가까운 수리된 프로그램은 15,000개의 훈련 에포크 후 평균 수익 185를 기록한 정밀화된 정책을 만들어내어 기호적 수리의 효과를 입증했다.
  • TRPO를 사용해 25회의 에피소드 동안 미세조정한 결과, 거의 최적의 프로그램에서 유도된 정책는 평균 수익 176.8을 기록했으며, 베이스라인보다 3배 이상 뛰어났다.
  • 수리된 기호적 정책에서 초기화된 TRPO 훈련 과정은 수렴 속도가 상당히 빨라졌으며, 이는 기호적 통찰이 학습을 가속화한다는 가설을 검증했다.
  • 이 프레임워크는 기호적 공간에서의 반복적 수리가 특히 열악한 초기화 상태에서 거의 최적의 정책로의 수렴 속도를 빠르게 한다는 점을 성공적으로 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.