Skip to main content
QUICK REVIEW

[論文レビュー] DouZero: Mastering DouDizhu with Self-Play Deep Reinforcement Learning

Daochen Zha, Jingru Xie|arXiv (Cornell University)|Jun 11, 2021
Digital Games and MediaSocial Sciences被引用数 21
ひとこと要約

DouZero は、不完全情報と膨大な行動空間を特徴とする複雑な3人 Trick-taking カードゲームである DouDizhu を、自己対戦による深層強化学習で習得するエージェントである。モンテカルロ木探索と深層ニューラルネットワークを組み合わせ、カード行列による行動符号化、並列自己対戦トレーニングを実施することで、人為的な抽象化やドメイン特化のヒューリスティクスに依存せずに、超人間の性能を達成した—Botzone ランキングで344体のエージェントの中から1位を獲得した。

ABSTRACT

Games are abstractions of the real world, where artificial agents learn to compete and cooperate with other agents. While significant achievements have been made in various perfect- and imperfect-information games, DouDizhu (a.k.a. Fighting the Landlord), a three-player card game, is still unsolved. DouDizhu is a very challenging domain with competition, collaboration, imperfect information, large state space, and particularly a massive set of possible actions where the legal actions vary significantly from turn to turn. Unfortunately, modern reinforcement learning algorithms mainly focus on simple and small action spaces, and not surprisingly, are shown not to make satisfactory progress in DouDizhu. In this work, we propose a conceptually simple yet effective DouDizhu AI system, namely DouZero, which enhances traditional Monte-Carlo methods with deep neural networks, action encoding, and parallel actors. Starting from scratch in a single server with four GPUs, DouZero outperformed all the existing DouDizhu AI programs in days of training and was ranked the first in the Botzone leaderboard among 344 AI agents. Through building DouZero, we show that classic Monte-Carlo methods can be made to deliver strong results in a hard domain with a complex action space. The code and an online demo are released at https://github.com/kwai/DouZero with the hope that this insight could motivate future work.

研究の動機と目的

  • 不完全情報と膨大で動的な行動空間を有する挑戦的な3人 Trick-taking ゲームである DouDizhu 用の強力なAIエージェントを開発すること。
  • DQN や A3C のような従来の強化学習アルゴリズムが、大規模な行動空間において過大評価や一般化の悪さを抱える問題を克服すること。
  • キッカー ネットワークや分解ルールなどの人為的なヒューリスティクスや行動抽象化に依存しないこと。これらは誤りが多く、計算コストが高いため。
  • 古典的なモンテカルロ手法が深層学習と組み合わせることで、複雑で高次元のゲーム環境において強力な性能を発揮できるかを示すこと。
  • 1台のサーバーと4つのGPUを用いて、自己対戦のみでエージェントを完全にスクラッチから訓練し、従来の方法に比べてはるかに短時間で超人間の性能を達成すること。

提案手法

  • 並列エージェントを用いた自己対戦強化学習フレームワークを採用し、多様なゲーム進行を効率的に生成する。
  • 原始的なカード状態を入力として、方策関数と価値関数を予測する深層ニューラルネットワークを用いてモンテカルロ木探索(MCTS)を強化する。
  • 行動をカード行列(例:ペア、連続順序、組み合わせなど)として符号化することで、未学習の合法的行動に対しても一般化を可能にする。
  • 残差畳み込みニューラルネットワークを用いて手札を処理し、行動表現を符号化することで、一般化性能を向上させ、過大評価バイアスを低減する。
  • 自己対戦中に重み付き方策(WP)目的関数を適用し、学習の安定化と方策収束の改善を図る。
  • 人為的なデモンストレーションやヒューリスティクスの事前知識を一切使用せず、ゲームルールと自己対戦のみでエージェントをエンドツーエンドでスクラッチから訓練する。

実験結果

リサーチクエスチョン

  • RQ1人為的な行動抽象化に依存せずに、自己対戦による深層強化学習エージェントが DouDizhu で超人間の性能を達成できるか?
  • RQ2ニューラルネットワークで強化されたモンテカルロ木探索は、DouDizhu の巨大で動的な行動空間を効果的に処理できるか?
  • RQ3カード行列による行動符号化は、複雑なカードゲームにおけるレアまたは未学習の合法的手の一般化にどの程度寄与するか?
  • RQ41台のサーバーと4つのGPUでスクラッチから訓練されたシステムは、複雑なヒューリスティクスやベイズ推論に依存する既存のAIエージェントを上回れるか?
  • RQ5ドメイン特化の抽象化が欠如することで、不完全情報かつチームベースのトランプゲームにおいてより頑健で一般化可能な方策が得られるか?

主な発見

  • DouZero は、数日間のトレーニング後、344体のエージェントの中から Botzone ランキングで1位を獲得し、既存のすべての DouDizhu AI プログラムを上回った。
  • 半日程度のトレーニングで、CQN やヒューリスティクスベースのエージェントといった強力なベースラインに対して90%を超える勝率を達成した。
  • DouZero は、ベイズ推論とヒューリスティクスキッカーに依存していた先行のSOTAエージェントである DeltaDou をも上回った。DeltaDou は2か月以上のトレーニングを要した。
  • モデルは優れた一般化性能を示し、行動符号化機構のおかげで、まれなまたは未学習のカードコンビネーションに対しても効果的に対処できた。
  • 人為的な抽象化を一切使用せず、自己対戦とニューラルネットワークによる方策/価値ネットワークにのみ依存することで、超人間の性能を達成した。
  • カード行列符号化の導入により、標準的なDQNアプローチに比べ、トレーニング中に頻出しなかった行動に対しても一般化が可能になり、過大評価バイアスが低減された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。