Skip to main content
QUICK REVIEW

[論文レビュー] Human-Agent Cooperation in Bridge Bidding

Edward Lockhart, Neil Burch|arXiv (Cornell University)|Nov 28, 2020
Reinforcement Learning in Robotics参考文献 15被引用数 4
ひとこと要約

本論文では、模倣学習、探索、方策反復を組み合わせることで、人間との協調的ブリッジ・エンジンの訓練を目的とした強化学習手法を提示する。得られたエージェントは、人間エキスパートとペアを組んだ際、WBridge5という強力な手動コード化ボットを0.97 IMP/デールの差で上回ったが、同時に人間のブリッジ・コンベンションと完全に互換性を持つことを維持した。

ABSTRACT

We introduce a human-compatible reinforcement-learning approach to a cooperative game, making use of a third-party hand-coded human-compatible bot to generate initial training data and to perform initial evaluation. Our learning approach consists of imitation learning, search, and policy iteration. Our trained agents achieve a new state-of-the-art for bridge bidding in three settings: an agent playing in partnership with a copy of itself; an agent partnering a pre-existing bot; and an agent partnering a human player.

研究の動機と目的

  • ブリッジ・エンジンという複雑で情報伝達が重要な分野において、人間プレーヤーと効果的に協調できるAIエージェントを開発すること。
  • 既存の手動コード化ボットを上回る性能を発揮しつつも、人間のブリッジ・コンベンションと互換性を維持すること。
  • 模倣学習と繰り返し方策改善を通じて、協調戦略を学習・精錬できるようにエージェントを訓練すること。
  • エージェントの性能をボットとの対戦だけでなく、エキスパート人間プレーヤーと直接ペアを組ませた状況でも評価すること。
  • 保守的でソフトな方策更新を用いることで、エージェントの方策が人間のコンベンションと互換性を保つようにすること。

提案手法

  • まず、人間と互換性のあるWBridge5ボットがプレイした手のデータセットから模倣学習を用いて方策を初期化する。
  • 探索アルゴリズムを用いて、事前方策とロールアウトからの結果を組み合わせることで方策を改善し、将来の可能性のある行動をシミュレートする。
  • 最大16ラウンドにわたる方策反復を実施する。各ラウンドでは、現在の方策と探索結果を用いて新しいデータセットを生成し、その後で再トレーニングを行う。
  • トレーニング中は、WBridge5の方策をパートナーとして使用することで互換性を保証する。また、テスト時にさらに大きな探索を適用することで、さらなる性能向上を図ることも可能である。
  • 本手法は、パートナーが初期方策に従うものと仮定しており、これにより互換性のない戦略的革新を抑制し、協調性を促進する。
  • 最終的なエージェントは、人間が参加するループ環境で評価された。この環境では、人間エキスパートがエージェントとボットをランダムな座席位置で32デールにわたりペアを組んだ。

実験結果

リサーチクエスチョン

  • RQ1標準的な人間のブリッジ・コンベンションに従いながら、人間との協調的ブリッジ・エンジンで動作するAIエージェントを訓練できるか?
  • RQ2模倣学習と方策反復をどのように組み合わせれば、人間との互換性を損なわずに性能を向上させられるか?
  • RQ3強力な手動コード化ボットと協調するように訓練されたエージェントは、人間エキスパートとペアを組んだ場合にも、そのボットを上回る性能を発揮するか?
  • RQ4エージェントの性能向上は、戦略の向上によるものか、それともダブル・ダミー評価の仮定や情報の隠蔽によるものか、その程度はどの程度か?
  • RQ5エージェントは、既存の人のコンベンションと互換性を保ちつつ、確立されたボットを上回る性能を発揮できるか?

主な発見

  • 人間エキスパートとペアを組んだ際、エージェントはWBridge5を0.97 IMP/デールの差で上回ったが、平均の標準誤差は0.76であった。
  • 人間エキスパートは、エージェントがStandard American Yellow Cardシステムに従っていたと観察したが、システムやコンベンションの違いはなく、判断の違いに限られていた。
  • 競合入札において、エージェントはやや攻撃的であり、現代のエキスパート人間プレーヤーの実践と一致していた。
  • エージェントはより単純で直接的な入札を好んだが、これは解釈の違いに対してより頑健である。
  • 性能向上はダブル・ダミー評価の仮定や入札中の情報隠蔽によるものではなく、真の戦略的改善によるものであることが示された。
  • エージェントはWBridge5と互換性を保ち、同じ人間エキスパートとペアを組んでもWBridge5を上回った。これは、強力な人間との互換性と協調能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。