Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Compositional Neural Programs with Recursive Tree Search and Planning

Thomas Pierrot, Guillaume Ligner|arXiv (Cornell University)|2019. 05. 30.
Reinforcement Learning in Robotics참고 문헌 38인용 수 13
한 줄 요약

이 논문은 실행 트레이서 없이 프로그램 사양과 정확성 테스트만을 사용하여 신경 프로그래머-해석기(NPIs)를 훈련하는 강화학습 알고리즘인 AlphaNPI를 소개한다. NPI에 재귀적 트리 탐색과 AlphaZero 스타일의 계획 기법을 통합함으로써, AlphaNPI는 정렬 작업에서 뛰어난 성능을 발휘하며, 임의의 하노이의 탑 퍼즐로 일반화되어 강화학습 기반의 지도 학습 기준선과 동등한 성능을 달성한다.

ABSTRACT

We propose a novel reinforcement learning algorithm, AlphaNPI, that incorporates the strengths of Neural Programmer-Interpreters (NPI) and AlphaZero. NPI contributes structural biases in the form of modularity, hierarchy and recursion, which are helpful to reduce sample complexity, improve generalization and increase interpretability. AlphaZero contributes powerful neural network guided search algorithms, which we augment with recursion. AlphaNPI only assumes a hierarchical program specification with sparse rewards: 1 when the program execution satisfies the specification, and 0 otherwise. Using this specification, AlphaNPI is able to train NPI models effectively with RL for the first time, completely eliminating the need for strong supervision in the form of execution traces. The experiments show that AlphaNPI can sort as well as previous strongly supervised NPI variants. The AlphaNPI agent is also trained on a Tower of Hanoi puzzle with two disks and is shown to generalize to puzzles with an arbitrary number of disk

연구 동기 및 목표

  • 기존에 전체 실행 트레이서가 필요로 하는 신경 프로그래머-해석기(NPIs) 훈련에서 강력한 지도 학습의 필요성을 제거하기 위해.
  • 실행 트레이서 대신 프로그램 사양과 정확성 테스트를 사용하여 NPI의 효과적인 강화학습(RL) 훈련을 가능하게 하기 위해.
  • 계층적이고 재귀적인 프로그램 구조를 활용하여 강화학습 에이전트의 일반화 능력과 해석 가능성 향상을 위해.
  • 몬테 카를로 트리 탐색(MCTS) 계획 기법이 조합 최적화 작업에서 순수 신경망 정책에 비해 성능을 크게 향상시킨다는 것을 입증하기 위해.

제안 방법

  • 엔드 투 엔드 강화학습 훈련을 가능하게 하기 위해 NPI를 액터-크리틱 네트워크로 재구성한다.
  • 계층적이고 재귀적인 프로그램 조합을 다룰 수 있도록 NPI 프레임워크에 재귀적 트리 탐색과 AlphaZero 스타일의 MCTS 계획 기법을 통합한다.
  • 희소 보상 신호를 사용: 프로그램 실행이 사양을 충족하면 1, 그렇지 않으면 0.
  • 온도 제어 스케줄러를 사용한 커리큘럼 학습을 적용하여 점차적으로 작업 난이도를 높인다.
  • MCTS에서의 탐색 균형을 확보하기 위해 딜레트 분포 노이즈와 PUCT 기반 탐색 기법을 통합한다.
  • 훈련 중 재귀적 프로그램 트레이서 발견을 장려하기 위해 재귀적 실행 페널티($r_{\text{pen-recur}}$)를 적용한다.

실험 결과

연구 질문

  • RQ1실행 트레이서 없이도 NPI가 강화학습을 통해 효과적으로 훈련될 수 있는가?
  • RQ2정확성 피드백과 프로그램 사양만으로도 재귀적 프로그램 구조를 강화학습을 통해 학습할 수 있는가?
  • RQ3MCTS 기반 계획 기법이 직접 정책 학습에 비해 NPI 훈련에서 샘플 효율성과 성능을 크게 향상시키는가?
  • RQ4작은 인스턴스에서 관찰된 행동을 바탕으로 더 큰 문제 인스턴스(예: 하노이의 탑에서 더 많은 디스크)로 일반화할 수 있는가?

주요 결과

  • AlphaNPI는 실행 트레이서 없이 희소 보상만을 사용함에도 불구하고 버블 정렬 작업에서 강화학습 기반 지도 학습 기반 NPI 변종과 유사한 성능을 달성한다.
  • 에이전트는 작은 인스턴스에서의 행동을 바탕으로 인도적 추론를 통해 임의의 디스크 수를 가진 하노이의 탑 퍼즐을 성공적으로 일반화하여 해결한다.
  • 추론 시 MCTS 계획 기법을 사용하는 에이전트가 순수 신경망 정책에 비해 성능이 뛰어나며, 조합적 프로그램을 위한 샘플 효율적인 강화학습에서 계획의 핵심적 역할을 입증한다.
  • 재귀적 실행 페널티는 재귀적 프로그램 트레이서 발견을 효과적으로 장려하여 올바른 재귀적 해법을 학습할 가능성을 높인다.
  • CPU 전용 환경(12개 CPU, GPU 없음)에서도 환경당 약 2시간 내외로 훈련이 가능하여 보편적인 하드웨어 환경에서도 실행 가능함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.