Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Strong and Human-Like Gameplay with KL-Regularized Search

Athul Paul Jacob, David Wu|arXiv (Cornell University)|Dec 14, 2021
Sports Analytics and Performance被引用数 4
ひとこと要約

本稿では、チェス、ゴ・ディプロマシー、ハナビで、強力なパフォーマンスと人間らしい行動のバランスをとるためにKL正則化探索を提案する。モンテカルロ木探索(MCTS)とレジーツミニマリゼーション(piKL-hedge)において、模倣学習で得た方策を参照としてKLダイバージェンス正則化を統合することで、模倣学習のみに比べて優れた人間予測精度と、より強いゲームプレイを実現した。

ABSTRACT

We consider the task of building strong but human-like policies in multi-agent decision-making problems, given examples of human behavior. Imitation learning is effective at predicting human actions but may not match the strength of expert humans, while self-play learning and search techniques (e.g. AlphaZero) lead to strong performance but may produce policies that are difficult for humans to understand and coordinate with. We show in chess and Go that regularizing search based on the KL divergence from an imitation-learned policy results in higher human prediction accuracy and stronger performance than imitation learning alone. We then introduce a novel regret minimization algorithm that is regularized based on the KL divergence from an imitation-learned policy, and show that using this algorithm for search in no-press Diplomacy yields a policy that matches the human prediction accuracy of imitation learning while being substantially stronger.

研究の動機と目的

  • 強力なAI方策と人間らしい行動のギャップを、マルチエージェント意思決定において解消すること。
  • 複雑な戦略的ゲームにおけるパフォーマンスを損なわず、人間予測精度を向上させること。
  • 模倣学習と探索ベースの計画を統合する一貫したフレームワークを構築し、人間の価値観に整合した強力な方策を実現すること。
  • 標準的なMCTSが適用できない不完全情報ゲームにこのアプローチを拡張すること。
  • 人間との協働に適した、高水準の実行能力と解釈可能性を併せ持つAIエージェントを可能にすること。

提案手法

  • MCTSにおける探索方策と模倣学習で得た方策とのKLダイバージェンスを正則化項として用い、探索を人間らしい行動に偏らせる。
  • 人間の模倣方策を基準とする新しいレジーツミニマリゼーションアルゴリズムであるpiKL-hedgeに正則化を適用する。
  • レジーツミニマリゼーションの利得関数に報酬項とKLダイバージェンス正則化項(係数λ)を組み込む。
  • 累積のレジーツに基づく指数的重み付けによる方策更新を実施し、正則化利得関数が方策の進化を導く。
  • 方策が人間の行動に近づくように保証するため、アンカー方策τを参照として用いる。
  • 完全情報ゲーム(チェス、ゴ)、一回ラウンドの不完全情報ゲーム(ノープレス・ディプロマシー)、逐次ゲーム(ハナビ)の複数のドメインにこの手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1KL正則化探索は、純粋な模倣学習方策を上回るパフォーマンスを維持しながら、人間予測精度を向上させることができるか?
  • RQ2複雑な戦略的ゲームにおいて、探索ベースの計画をどのように正則化すれば、強力で人間らしい方策を生成できるか?
  • RQ3不完全情報ゲームにおいて、人間の模倣方策に向かうKL正則化を組み込んだレジーツミニマリゼーションアルゴリズムをどのように適応できるか?
  • RQ4探索におけるKL正則化は、協力的または混合動機の状況において、人間の慣習に適合する方向に効果をもたらすか?
  • RQ5正則化の方向(KL(π||τ) 対 KL(τ||π))の選択が、レジーツミニマリゼーションにおける収束性とパフォーマンスに与える影響はどの程度か?

主な発見

  • チェスとゴにおいて、模倣学習方策を事前分布として用いたKL正則化MCTSは、模倣学習のみに比べて人間予測精度が向上した。
  • この手法により、純粋な模倣学習よりも強い方策が得られるとともに、チェスとゴの両方で人間予測精度を維持または上回った。
  • ノープレス・ディプロマシーにおいて、piKL-hedgeは模倣学習と同等の人間予測精度を達成したが、先行エージェントとの対戦では著しく強いパフォーマンスを示した。
  • レジーツミニマリゼーションアルゴリズムpiKL-hedgeは、アンカー方策と逸脱コストを考慮した均衡に収束することが証明された。
  • ハナビにおいて、SPARTA探索アルゴリズムにKL正則化を適用することで、人間予測精度が向上し、ベースラインの模倣学習に比べて著しくパフォーマンスが向上した。
  • 本手法は、テストした4つのドメインすべてにおいて、純粋な模倣ベースのモデルよりも人間らしい行動を示し、かつより強いエージェントを一貫して生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。