Skip to main content
QUICK REVIEW

[논문 리뷰] Monte Carlo Tree Search for Asymmetric Trees

Thomas M. Moerland, Joost Broekens|arXiv (Cornell University)|2018. 05. 23.
Artificial Intelligence in Games참고 문헌 13인용 수 4
한 줄 요약

이 논문은 비확률적이고 완전 관측 가능한 환경에서 비대칭 트리와 순환 구조를 가진 상황에서 효율성을 높이기 위해 몬테카를로 트리 탐색(MCTS)의 두 가지 확장인 MCTS-T와 MCTS-T+을 제안한다. 트리 구조의 불확실성($σ_{τ}$)을 백업하고 이를 수정된 UCB 공식에 활용함으로써, 표준 MCTS보다 성능이 뛰어나며, 특히 체인 작업과 아케이드 게임인 아케이드 2600 게임과 같은 비대칭 영역에서 뛰어난 성능을 보인다. 대칭적인 경우에서는 성능 저하가 발생하지 않는다.

ABSTRACT

We present an extension of Monte Carlo Tree Search (MCTS) that strongly increases its efficiency for trees with asymmetry and/or loops. Asymmetric termination of search trees introduces a type of uncertainty for which the standard upper confidence bound (UCB) formula does not account. Our first algorithm (MCTS-T), which assumes a non-stochastic environment, backs-up tree structure uncertainty and leverages it for exploration in a modified UCB formula. Results show vastly improved efficiency in a well-known asymmetric domain in which MCTS performs arbitrarily bad. Next, we connect the ideas about asymmetric termination to the presence of loops in the tree, where the same state appears multiple times in a single trace. An extension to our algorithm (MCTS-T+), which in addition to non-stochasticity assumes full state observability, further increases search efficiency for domains with loops as well. Benchmark testing on a set of OpenAI Gym and Atari 2600 games indicates that our algorithms always perform better than or at least equivalent to standard MCTS, and could be first-choice tree search algorithms for non-stochastic, fully-observable environments.

연구 동기 및 목표

  • 서브트리 깊이가 크게 다를 수 있는 비대칭 탐색 트리에서 표준 MCTS의 비효율성을 해결하기 위해.
  • 같은 상태가 한 번의 탐색 경로에서 여러 번 나타나는 순환적인 트리에서의 MCTS를 처리하기 위해.
  • 구조적 불확실성($\sigma_{\tau}$)을 UCB 공식에 통합하여 탐색과 이용의 균형을 향상시키기 위해.
  • 강한 비대칭성과 순환성을 가진 환경에서 제안된 알고리즘을 평가하기 위해, OpenAI Gym과 아케이드 2600 게임을 포함한다.
  • 비확률적이고 완전 관측 가능한 도메인에서 구조적 복잡성이 있는 상황에서 표준 MCTS의 대안으로 MCTS-T(+)를 우선 선택할 수 있도록 하기 위해.

제안 방법

  • 트리 구조의 불확실성($\sigma_{\tau}$)을 MCTS의 새로운 백업 값으로 도입하여, 서브트리의 깊이와 구조에 대한 불확실성을 나타낸다.
  • UCB 공식을 수정하여 $\sigma_{\tau}$를 포함함으로써, 표준 MCTS가 간과하는 비대칭 서브트리 탐색을 가능하게 한다.
  • 비확률적 환경를 대상으로 MCTS-T를 제안하며, $\sigma_{\tau}$를 활용해 비대칭 트리에서의 탐색을 이끌어낸다.
  • 완전 관측 가능한 환경에서 순환 탐지 및 차단 기능을 추가하여 MCTS-T를 MCTS-T+로 확장한다.
  • 선택 단계에서 $\sigma_{\tau}$를 활용하는 수정된 트리 정책을 사용하여, 더 높은 구조적 불확실성을 가진 노드를 우선순위로 지정한다.
  • 리프 노드에서부터 상향식으로 $\sigma_{\tau}$를 백업함으로써, 각 노드의 루트가 되는 서브트리의 불확실성을 반영한다.

실험 결과

연구 질문

  • RQ1표준 MCTS가 비효율적으로 작동하는 비대칭 트리에서 MCTS의 효율성을 어떻게 높일 수 있는가?
  • RQ2트리 구조의 불확실성($\sigma_{\tau}$)을 효과적으로 캡처하고 MCTS의 탐색을 향상시키기 위해 어떻게 활용할 수 있는가?
  • RQ3순환 탐지 및 차단 기능이 한 번의 탐색 경로에서 반복되는 상태가 존재하는 도메인에서 MCTS 성능을 더욱 향상시킬 수 있는가?
  • RQ4아케이드 2600 게임과 OpenAI Gym 작업과 같은 순환성과 비대칭성이 있는 환경에서 MCTS-T+가 표준 MCTS를 능가하는가?
  • RQ5제안된 방법은 대칭적인 환경에서도 안정적인가? 표준 MCTS보다 성능 저하가 발생하지 않는가?

주요 결과

  • 표준 MCTS가 임의로 실패할 수 있는 비대칭 문제의 대표적인 예인 체인 도메인에서 MCTS-T는 표준 MCTS보다 뚜렷이 뛰어난 성능을 보였다.
  • 루프가 존재하는 체인 도메인에서 MCTS-T+는 순환 차단 기능과 함께 구조적 불확실성의 이점을 더욱 극대화하여 성능을 향상시켰다.
  • 카트폴과 프로즌레이크에서 MCTS-T와 MCTS-T+는 표준 MCTS를 일관되게 능가했으며, 특히 탐색 수가 적을 경우 두드러진 성능 향상을 보였다.
  • 아케이드 2600 게임에서는 MCTS-T와 MCTS-T+가 표준 MCTS와 동등하거나 그 이상의 성능을 보였으며, 특히 탐색 예산이 작은 경우에 뚜렷한 향상이 있었다.
  • 대칭적인 환경에서는 알고리즘이 항상 표준 MCTS를 열등하게 하지 않아, 기본 선택지로 사용하는 데 안전하다.
  • $\sigma_{\tau}$ 백업을 통해 모든 서브트리가 완전히 열거되었을 때($\sigma_{\tau} = 0$) 조기 종료가 가능해져 계산 효율성이 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.