Skip to main content
QUICK REVIEW

[論文レビュー] Optimize Neural Fictitious Self-Play in Regret Minimization Thinking

Yuxuan Chen, Li Zhang|arXiv (Cornell University)|Apr 22, 2021
Artificial Intelligence in Games参考文献 20被引用数 4
ひとこと要約

本稿では、Neural Fictitious Self-Play (NFSP) の変種として、最適性ギャップの減少を保証するレジーツ最小化を強化した手法を提案する。この手法は、元のNFSPの最良応答計算を、レジーツマッチング手法であるアドバンテージベースレジーツ最小化(ARM)に置き換える。最適性ギャップが単調に減少することを保証することで、新しい手法はOpenSpielにおける完全情報および不完全情報ゲームの複数の環境で、元のNFSPよりも高速に収束し、優れた不利用可能性と勝率を達成する。

ABSTRACT

Optimization of deep learning algorithms to approach Nash Equilibrium remains a significant problem in imperfect information games, e.g. StarCraft and poker. Neural Fictitious Self-Play (NFSP) has provided an effective way to learn approximate Nash Equilibrium without prior domain knowledge in imperfect information games. However, optimality gap was left as an optimization problem of NFSP and by solving the problem, the performance of NFSP could be improved. In this study, focusing on the optimality gap of NFSP, we have proposed a new method replacing NFSP's best response computation with regret matching method. The new algorithm can make the optimality gap converge to zero as it iterates, thus converge faster than original NFSP. We have conduct experiments on three typical environments of perfect-information games and imperfect information games in OpenSpiel and all showed that our new algorithm performances better than original NFSP.

研究の動機と目的

  • Neural Fictitious Self-Play (NFSP) における持続的な最適性ギャップが収束速度と均衡品質を制限するという問題に取り組む。
  • レジーツ最小化技術がNFSPの最良応答計算を最適化し、収束挙動を改善できるかどうかを調査する。
  • 訓練中に最適性ギャップが単調に減少することを保証する手法を開発し、より高速で安定した収束を実現する。
  • 多様なゲーム環境、特に完全情報および不完全情報ゲームを含む環境で、提案手法の一般化可能性と性能向上を評価する。

提案手法

  • NFSPの深層強化学習に基づく最良応答計算を、レジーツマッチング手法であるアドバンテージベースレジーツ最小化(ARM)に置き換える。
  • 反復的に行動ごとのレジーツを最小化するレジーツマッチングを適用し、各更新で最適性ギャップが単調に減少することを保証する。
  • NFSPの二重ストリームアーキテクチャを維持する:一方のストリームはFictitious Playと同様に方策の平均化を処理し、もう一方はARMによる最良応答を処理する。
  • 相手の平均戦略を入力として用い、レジーツ最小化最良応答を計算することで、各イテレーションで戦略の質を向上させる。
  • ARMをNFSPフレームワークに統合し、FSPとレジーツ最小化の長所を組み合わせたハイブリッド自己対戦アルゴリズムを構築する。
  • レジーツマッチングによる最適性ギャップの単調減少を採用することで、理論的にナッシュ均衡への収束を保証する。

実験結果

リサーチクエスチョン

  • RQ1レジーツ最小化技術は、NFSPの最良応答計算における最適性ギャップを低減できるか?
  • RQ2NFSPの最良応答をレジーツマッチング手法に置き換えることで、自己対戦訓練における収束が速くなるか?
  • RQ3提案手法は、完全情報および不完全情報ゲームの両方で、元のNFSPよりも優れた不利用可能性と勝率を達成できるか?
  • RQ4ARMをNFSPに適用した実践的状況において、最適性ギャップの単調減少は達成可能で有益であるか?
  • RQ5異なるゲーム環境、特に先手優位があるゲームを含む環境において、新しい手法の性能はNFSPと比べてどのように異なるか?

主な発見

  • 提案手法は、Tic Tac Toeや他のOpenSpielゲームを含むすべてのテスト環境で、元のNFSPよりも不利用性が低く、収束が高速かつ安定している。
  • Tic Tac Toeでは、先手としてプレーした際の勝率が83.7%に達し、後手としてプレーした際には67.4%の勝率(30.9%の引き分けを含む)を記録し、NFSPを著しく上回った。
  • 先手としてプレーした際の平均報酬は0.80に達し、後手としてプレーした際には0.658に達した。これは、不利な位置においても強力な性能を示している。
  • 学習曲線から、新しい手法は先手および後手の両方の状況でNFSPよりも速く収束しており、より高い安定性と報酬の進行を示している。
  • 最適性ギャップが反復回数に伴い単調に減少することが実験的に示され、理論的主張である収束挙動の改善が裏付けられた。
  • 3つのテスト環境すべてで一貫した性能向上が確認され、レジーツ最小化をNFSPフレームワークに統合する有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。