[論文レビュー] Feedback-Based Tree Search for Reinforcement Learning
本稿では、有限時 horizon MDP におけるモンテカルロ木探索 (MCTS) を用いて、反復的に方策および価値関数の近似を改善するバッチ型、モデルベース強化学習手法であるフィードバックベース木探索 (FBTS) を提案する。MCTS が生成するフィードバックを通じて葉ノード評価関数を精緻化することで、FBTS は MOBA ゲーム『キング・オブ・グロリィ』において、DQN や AVI、教師あり学習ベースラインを上回る最先端の性能を達成するとともに、木探索ベースの強化学習における最初のサンプル複雑性バウンドを提供する。
Inspired by recent successes of Monte-Carlo tree search (MCTS) in a number of artificial intelligence (AI) application domains, we propose a model-based reinforcement learning (RL) technique that iteratively applies MCTS on batches of small, finite-horizon versions of the original infinite-horizon Markov decision process. The terminal condition of the finite-horizon problems, or the leaf-node evaluator of the decision tree generated by MCTS, is specified using a combination of an estimated value function and an estimated policy function. The recommendations generated by the MCTS procedure are then provided as feedback in order to refine, through classification and regression, the leaf-node evaluator for the next iteration. We provide the first sample complexity bounds for a tree search-based RL algorithm. In addition, we show that a deep neural network implementation of the technique can create a competitive AI agent for the popular multi-player online battle arena (MOBA) game King of Glory.
研究の動機と目的
- リアルタイム意思決定環境(例:ビデオゲーム)におけるオンライン木探索の遅さという課題に対処すること。
- MCTS を計画のためのものにとどめず、グローバル方策および価値関数近似の改善に向けた学習信号として活用する手法の開発。
- バッチ型 MCTS に基づく RL アルゴリズムのサンプル複雑性バウンドを理論的に導出し、理論的理解のギャップを埋めること。
- 複雑で現実世界の環境である『キング・オブ・グロリィ』(Arena of Valor)において、本手法の有効性を実証すること。
提案手法
- 元の無限時 horizon MDP から得られるバッチ処理された有限時 horizon MDP に対して、価値関数と方策関数の組み合わせを葉ノード評価関数として用いて MCTS を適用する。
- 各 MCTS 実行後、ルートノードの観測(行動と報酬)を用いて、回帰と分類による手法で価値関数および方策関数の近似器を更新する。
- 更新された関数が次の反復で改善された葉ノード評価関数として再利用され、MCTS の性能が時間経過とともに向上するフィードバックループを形成する。
- 並列シミュレーションを可能にし相関を低減するため、UCB スコアのソフトマックスサンプリングを用いた修正版 UCT を使用する。
- 関数近似器は SELU 活性化関数を用いた深層ニューラルネットワークで実装され、回帰にはコサイン類似度損失、分類には負の対数尤度損失が使用される。
- 相関を低減するため、ロールアウトからの 2/3 の状態が破棄され、MCTS ロールアウト中にノイズが注入され、探索が向上する。
実験結果
リサーチクエスチョン
- RQ1MCTS からのフィードバックを用いて、バッチ強化学習設定において価値関数および方策関数の近似を反復的に改善できるか?
- RQ2木探索ベースの強化学習アルゴリズムのサンプル複雑性は何か? そして、理論的にバウンド可能か?
- RQ3フィードバックベースの MCTS 手法は、複雑でリアルタイムのビデオゲームにおいて、標準的な RL ベースラインを上回れるか?
- RQ4静的価値関数や方策関数を葉ノード評価関数として使用する場合と比較して、フィードバック機構はどのように方策性能を向上させるか?
主な発見
- FBTS は 1v1 の『キング・オブ・グロリィ』対戦において、DPI や AVI、SL、および内部の DiRenJie AI ベースラインを著しく上回り、6体の選択された相手ヒーローに対して高い勝率を達成した。
- FBTS は相手に対して 1.25 から 1.75 のゴールドレシオを記録し、ゲーム内での経済的優位性と一貫性あるパフォーマンスを示した。
- 本手法は、バッチ型 MCTS に基づく RL アルゴリズムにおける最初の理論的サンプル複雑性バウンドを提供し、十分なデータと探索努力がある場合、近似的最適方策への収束を示した。
- FBTS の深層ニューラルネットワーク実装は、教師あり学習や価値反復ベースラインを上回る競争力を持つ AI アgent を生成した。
- NR(別の MCTS ベースのエージェント)と比較して、FBTS の性能向上はわずかにしか得られていないため、MCTS ベースのフィードバックは有効ではあるが、両エージェントが類似した探索メカニズムを使用する場合、顕著な優位性までは得られないことが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。