[논문 리뷰] Feedback-Based Tree Search for Reinforcement Learning
이 논문은 유한한 시간 간격 MDP에서 몬테카를로 트리 탐색(MCTS)을 사용하여 정책 및 가치 함수 근사치를 반복적으로 향상시키는 배치, 모델 기반 강화학습 방법인 피드백 기반 트리 탐색(FBTS)을 제안한다. MCTS가 생성한 피드백을 통해 낙엽 노드 평가자들을 개선함으로써, FBTS는 MOBA 게임 '킹 오브 글로리'에서 DQN, AVI 및 지도학습 기반 베이스라인을 능가하는 최신 기술 수준의 성능을 달성하였으며, 트리 탐색 기반 강화학습에 대한 첫 번째 샘플 복잡도 한계를 제공한다.
Inspired by recent successes of Monte-Carlo tree search (MCTS) in a number of artificial intelligence (AI) application domains, we propose a model-based reinforcement learning (RL) technique that iteratively applies MCTS on batches of small, finite-horizon versions of the original infinite-horizon Markov decision process. The terminal condition of the finite-horizon problems, or the leaf-node evaluator of the decision tree generated by MCTS, is specified using a combination of an estimated value function and an estimated policy function. The recommendations generated by the MCTS procedure are then provided as feedback in order to refine, through classification and regression, the leaf-node evaluator for the next iteration. We provide the first sample complexity bounds for a tree search-based RL algorithm. In addition, we show that a deep neural network implementation of the technique can create a competitive AI agent for the popular multi-player online battle arena (MOBA) game King of Glory.
연구 동기 및 목표
- 실시간 의사결정 환경(예: 비디오 게임)에서 느린 온라인 트리 탐색 문제를 해결하기 위해.
- MCTS를 단순한 계획 수단이 아닌, 전역 정책 및 가치 함수 근사치를 향상시키는 훈련 신호로 활용할 수 있는 방법을 개발하기 위해.
- 배치 MCTS 기반 RL 알고리즘에 대한 샘플 복잡도 한계를 이론적으로 제공함으로써 이론적 이해의 격차를 메우기 위해.
- 복잡한 실제 환경인 '킹 오브 글로리'(Arena of Valor)에서 접근 방식의 유효성을 입증하기 위해.
제안 방법
- 원래의 무한 시간 간격 MDP에서 유도된 유한 시간 간격 MDP의 배치에 대해 MCTS를 적용하며, 낙엽 노드 평가자로 가치 함수와 정책 함수의 조합을 사용한다.
- 각 MCTS 실행 후, 루트 노드 관측치(행동 및 수익)를 사용하여 회귀와 분류를 통해 가치 함수 및 정책 함수 근사치를 업데이트한다.
- 업데이트된 함수는 다음 반복에서 향상된 낙엽 평가자로 사용되어, 시간이 지남에 따라 MCTS 성능을 향상시키는 피드백 루프를 형성한다.
- 병렬 시뮬레이션을 가능하게 하고 상관관계를 줄이기 위해, UCB 점수에 대해 소프트맥스 샘플링을 사용한 수정된 UCT 변종을 사용한다.
- 함수 근사치는 SELU 활성화 함수를 사용하는 딥 네ural 네트워크로 구현되며, 회귀에는 코사인 유사도 손실, 분류에는 음의 로그 우도 손실을 사용한다.
- 상관관계를 줄이기 위해, 시뮬레이션에서 2/3의 상태를 기각하고, MCTS 시뮬레이션 중 노이즈를 주입하여 탐색을 향상시킨다.
실험 결과
연구 질문
- RQ1MCTS로부터의 피드백을 사용하여 배치 RL 환경에서 가치 함수 및 정책 함수 근사치를 반복적으로 향상시킬 수 있는가?
- RQ2트리 탐색 기반 강화학습 알고리즘의 샘플 복잡도는 무엇이며, 이는 이론적으로 한계를 가질 수 있는가?
- RQ3피드백 기반 MCTS 방법은 복잡한 실시간 비디오 게임에서 표준 RL 기반 베이스라인을 능가할 수 있는가?
- RQ4정적 가치 또는 정책 함수를 낙엽 평가자로 사용하는 것과 비교해, 피드백 메커니즘이 정책 성능을 어떻게 향상시키는가?
주요 결과
- FBTS는 1v1 킹 오브 글로리 대전에서 DPI, AVI, SL 및 내부 DiRenJie AI 기반 베이스라인을 크게 능가하여, 여섯 명의 선택된 상대 히어로 대비 높은 승률 기록을 달성하였다.
- FBTS는 상대 히어로 대비 골드 비율 1.25에서 1.75 사이를 기록하여 강력한 게임 내 경제적 우위와 일관된 성능을 보였다.
- 이 방법은 배치, MCTS 기반 RL 알고리즘에 대해 첫 이론적 샘플 복잡도 한계를 제공하였으며, 충분한 데이터와 탐색 노력이 확보될 경우 근사 최적 정책 수렴을 보였다.
- FBTS의 딥 네ural 네트워크 구현은 경쟁력 있는 AI 에이전트를 생성하였으며, MOBA 환경에서 지도학습 및 가치 이터레이션 기반 베이스라인을 초월하였다.
- FBTS는 NR(다른 MCTS 기반 에이전트)보다 약간 뛰어난 성능을 보였으며, 이는 MCTS 기반 피드백이 효과적임을 시사하지만, 둘 다 유사한 탐색 메커니즘을 사용할 경우 뚜렷한 우월성은 아니라는 것을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.