Skip to main content
QUICK REVIEW

[논문 리뷰] Divide-and-Conquer Monte Carlo Tree Search For Goal-Directed Planning

Giambattista Parascandolo, Lars Buesing|arXiv (Cornell University)|2020. 04. 23.
Reinforcement Learning in Robotics참고 문헌 35인용 수 9
한 줄 요약

이 논문은 학습된 하위목표 제안을 통해 작업을 하위 목표로 재귀적으로 분할하는 계층적 계획 알고리즘인 Divide-and-Conquer Monte Carlo Tree Search (DC-MCTS)를 제안한다. 순차적 계획기와 달리 DC-MCTS는 비순차적 계획 구축을 가능하게 하여 장수평 계획 과제에서 신용 할당과 성능을 크게 향상시키며, 격자형 환경과 MuJoCo 연속 제어 환경에서 최신 기술 수준의 성능을 기록한다.

ABSTRACT

Standard planners for sequential decision making (including Monte Carlo planning, tree search, dynamic programming, etc.) are constrained by an implicit sequential planning assumption: The order in which a plan is constructed is the same in which it is executed. We consider alternatives to this assumption for the class of goal-directed Reinforcement Learning (RL) problems. Instead of an environment transition model, we assume an imperfect, goal-directed policy. This low-level policy can be improved by a plan, consisting of an appropriate sequence of sub-goals that guide it from the start to the goal state. We propose a planning algorithm, Divide-and-Conquer Monte Carlo Tree Search (DC-MCTS), for approximating the optimal plan by means of proposing intermediate sub-goals which hierarchically partition the initial tasks into simpler ones that are then solved independently and recursively. The algorithm critically makes use of a learned sub-goal proposal for finding appropriate partitions trees of new tasks based on prior experience. Different strategies for learning sub-goal proposals give rise to different planning strategies that strictly generalize sequential planning. We show that this algorithmic flexibility over planning order leads to improved results in navigation tasks in grid-worlds as well as in challenging continuous control environments.

연구 동기 및 목표

  • 장수평 목표 지향 강화학습에서 순차적 계획의 한계, 특히 부적절한 신용 할당과 정확한 장수평 전이 모델에 대한 의존성 문제를 해결하기 위해.
  • 하위목표를 독립적으로 평가함으로써 순차적 계획기의 신용 할당 문제를 해결하고, 비순차적 순서로 계획을 수행할 수 있도록 하기 위해.
  • 복잡한 하위작업에 대해 계산 자원을 동적으로 할당하고, 하위목표 계층을 통해 시간 추상화를 지원하는 계획 알고리즘을 개발하기 위해.
  • 실행 순서와 다를 수 있는 유연한 계획 순서가 복잡한 탐색 환경에서 샘플 효율성과 성능을 향상시킬 수 있음을 보여주기 위해.
  • 학습된 하위목표 제안을 통한 계층적 계획이 이산 및 연속 제어 환경 모두에서 표준 MCTS보다 일반화 능력과 성능 면에서 뛰어나다는 것을 입증하기 위해.

제안 방법

  • DC-MCTS는 작업을 두 개의 독립적인 하위문제로 균형 잡힌 복잡도를 가진 중간 하위목표로 계층적으로 분할하는 것으로 계획을 설정한다.
  • 알고리즘은 이전 경험과 검색 결과를 바탕으로 유망한 하위목표를 탐색하는 데 도움이 되는 학습된 하위목표 제안 네트워크를 사용한다.
  • 각 하위작업에 대해 동일한 계획 과정을 재귀적으로 적용함으로써, 각 하위문제의 효과적 수평을 줄이는 분할-정복 전략을 구현한다.
  • 최종 계획이 단일 체인 대신 하위트리로 표현되는 수정된 트리 구조를 사용하는 몬테카를로 트리 탐색(MCTS)을 사용하여, 병렬 및 재사용 가능한 계산을 가능하게 한다.
  • 각 하위목표가 문제를 두 개의 더 짧은 수평 과제로 나누므로, 하위목표를 별도로 평가함으로써 신용 할당을 향상시킨다.
  • 이 방법은 개방 루프 및 폐루프 실행을 모두 지원한다: 저수준 정책이 국소적 실패를 처리하고, 고수준 계획기에서는 전체 폐루프 계획의 비용을 피한다.

실험 결과

연구 질문

  • RQ1비순차적 계획 전략이 장수평 목표 지향 강화학습에서 신용 할당을 향상시킬 수 있는가?
  • RQ2작업을 하위목표로 계층적으로 분해하는 것이 순차적 액션 단위 계획보다 더 효율적이고 확장 가능한가?
  • RQ3학습된 하위목표 제안 메커니즘이 복잡한 환경에서 최적의 작업 분해를 위한 탐색을 효과적으로 이끌 수 있는가?
  • RQ4DC-MCTS는 이산 및 연속 제어 탐색 과제에서 표준 MCTS와 비교해 샘플 효율성과 성공률 면에서 어떻게 다른가?
  • RQ5계획 순서의 유연성(실행 순서와 다를 수 있음)이 장수평 또는 희박 보상 환경에서 성능 향상에 얼마나 기여하는가?

주요 결과

  • DC-MCTS는 동일한 계획 예산 하에 격자형 환경과 MuJoCo 탐색 과제에서 표준 MCTS를 능가하는 성능을 기록하였다.
  • 높은 벽 밀도(d=1.0)를 가진 MuJoCo 환경에서 DC-MCTS는 MCTS가 편향된 검색 사전 지식으로 인해 '미세 관리' 문제를 겪는 데 비해 우수한 성능을 보였다.
  • MCTS에서 하위목표 선택에 왼쪽 우선 파싱을 사용하면 과도하게 세분화된 하위목표 제안이 발생하지만, DC-MCTS는 재귀적 분할을 통해 자동으로 적절한 하위목표 길이 척도를 발견하였다.
  • 검색 트리의 시각화 결과, DC-MCTS는 계획을 하위트리로 구성하여 병렬 탐색과 캐시된 하위문제 값의 재사용을 가능하게 하였으며, MCTS의 선형 체인 구조와는 다릅니다.
  • DC-MCTS는 복잡한 하위작업에 대해 계획 노력의 계산 자원을 동적으로 할당함으로써 계산 효율성을 향상시켰고, 전체 계획 복잡도를 감소시켰습니다.
  • 이 방법은 전방 및 후방 계획을 모두 포함하는 특수한 경우로 간주할 수 있기 때문에, 전방 및 후방 계획보다 엄밀히 더 일반적인 방법입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.