[論文レビュー] Playing the Werewolf game with artificial intelligence for language understanding
本稿では、自然言語理解を用いて嘘を検出したり、相手をだますことや戦略的投票を通じて勝利を狙うAIエージェント、Deep Wolfの提案を行う。このエージェントは、人間のゲームログを微調整したトランスフォーマー・モデルを用いて訓練されており、村人や裏切り者の役割において平均的人間プレイヤーと同等のパフォーマンスを達成しており、現在の言語モデルが社会的裏切りの文脈において嘘や矛盾を含む推論を行う能力を有していることを示している。
The Werewolf game is a social deduction game based on free natural language communication, in which players try to deceive others in order to survive. An important feature of this game is that a large portion of the conversations are false information, and the behavior of artificial intelligence (AI) in such a situation has not been widely investigated. The purpose of this study is to develop an AI agent that can play Werewolf through natural language conversations. First, we collected game logs from 15 human players. Next, we fine-tuned a Transformer-based pretrained language model to construct a value network that can predict a posterior probability of winning a game at any given phase of the game and given a candidate for the next action. We then developed an AI agent that can interact with humans and choose the best voting target on the basis of its probability from the value network. Lastly, we evaluated the performance of the agent by having it actually play the game with human players. We found that our AI agent, Deep Wolf, could play Werewolf as competitively as average human players in a villager or a betrayer role, whereas Deep Wolf was inferior to human players in a werewolf or a seer role. These results suggest that current language models have the capability to suspect what others are saying, tell a lie, or detect lies in conversations.
研究の動機と目的
- 自然言語コミュニケーションを用いてWerewolfゲームをプレイできるAIエージェントの開発を目的とする。これは、欺瞞と社会的推論が豊富に含まれる分野である。
- 事前学習済み言語モデルが、ゲーム内での嘘の検出、嘘の創出、および他のプレイヤーの役割に関する推論を学習できるかどうかを調査すること。
- 会話履歴に基づいて、任意のゲーム状態における勝利の事後確率を推定する価値ネットワークの構築。
- 人間プレイヤーとの実際のゲームにおいて、AIエージェントのパフォーマンスを評価し、異なる役割における勝率に注目する。
- 欺瞞と矛盾検出を含む自然言語理解におけるAIのベンチマークを提供すること。
提案手法
- 5人プレイのテキストベースのWerewolfゲームにおいて、15名の人のプレイヤーから48件のゲームログを収集。メモリ制約のため、32件を訓練に使用。
- 日本語のゲームログを英語に翻訳し、英語言語モデルで訓練可能にする。
- トランスフォーマーに基づく事前学習済み言語モデルを微調整し、ゲーム状態と候補行動を入力として、その状態における勝利の事後確率を予測する価値ネットワークを構築。
- 価値ネットワークの予測で最も高い勝利確率を示す候補を次回の投票対象として選択するAIエージェント、Deep Wolfを設計。
- 人間プレイヤーとの実際のゲームを実施し、村人、裏切り者、人狼、占い師の各役割における勝率を測定することでエージェントを評価。
- 価値ネットワークの出力を意思決定のヒューリスティックとして用い、不確実性下での戦略的推論を模倣する。
実験結果
リサーチクエスチョン
- RQ1人間のWerewolfゲームログで微調整された言語モデルは、実際のゲーム進行中に、自身の勝利確率をリアルタイムで推定できるか?
- RQ2AIエージェントは、自然言語理解を活用して、嘘を検出し、説得力のある虚偽を創出し、社会的裏切りゲームにおけるグループダイナミクスを操作できるか、その程度はいかほどか?
- RQ3自然言語ログで訓練されたAIエージェントのパフォーマンスは、村人、人狼、占い師などの異なる役割において、平均的人間プレイヤーと比較してどうなるか?
- RQ4ゲームログで訓練された価値ネットワークは、動的で欺瞞に満ちた会話環境において、投票対象などの戦略的意思決定を効果的にガイドできるか?
- RQ5人間とAIの対戦におけるAIエージェントの勝率はどの程度か。また、役割によってその勝率はどのように変化するか?
主な発見
- Deep Wolfは、村人または裏切り者の役割でプレイした際、平均的人間プレイヤーと同等の勝率を達成しており、欺瞞と社会的推論における優れたパフォーマンスを示している。
- 人狼や占い師の役割でプレイした際、人間プレイヤーよりパフォーマンスが低く、役割固有の戦略的深さや役割アイデンティティの管理に限界がある可能性を示唆している。
- 価値ネットワークは、ゲームのさまざまなフェーズで勝利確率を効果的に予測できており、会話の文脈に基づいた情報に基づいた投票意思決定を可能にした。
- エージェントは他者の発言における一貫性の欠如を検出し、それを投票結果に影響を与えるために活用できており、効果的な嘘の検出能力を示している。
- Deep Wolfが人狼としてプレイした一連のゲームでは、無実を装い、他者への疑いを向けさせるなどしてグループを操作し、勝利に導いた。
- 本研究は、自然言語理解を用いてWerewolfをプレイするAIエージェントの最初の実証的評価を提供しており、各役割における測定可能な勝率を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。