Skip to main content
QUICK REVIEW

[論文レビュー] Beyond Winning and Losing: Modeling Human Motivations and Behaviors Using Inverse Reinforcement Learning

Baoxiang Wang, Tongfang Sun|arXiv (Cornell University)|Jul 1, 2018
Digital Games and Media参考文献 19被引用数 6
ひとこと要約

本稿では、環境のダイナミクスや反事実的行動の情報が不要な逆強化学習フレームワークであるMulti-Motivation Behavior Modeling (MMBM) を提案する。MMBMは、プレイグラウンドの軌道から多次元的人間の動機を推定する。アバター歴史データセットを用いたWorld of Warcraftへの適用により、MMBMはプレイヤーの価値構造を正確に回復し、先行手法を上回る行動予測性能を示し、ゲームアップデートがAdvancement や Competition といった動機に与える影響を定量的に評価できる。

ABSTRACT

In recent years, reinforcement learning (RL) methods have been applied to model gameplay with great success, achieving super-human performance in various environments, such as Atari, Go, and Poker. However, those studies mostly focus on winning the game and have largely ignored the rich and complex human motivations, which are essential for understanding different players' diverse behaviors. In this paper, we present a novel method called Multi-Motivation Behavior Modeling (MMBM) that takes the multifaceted human motivations into consideration and models the underlying value structure of the players using inverse RL. Our approach does not require the access to the dynamic of the system, making it feasible to model complex interactive environments such as massively multiplayer online games. MMBM is tested on the World of Warcraft Avatar History dataset, which recorded over 70,000 users' gameplay spanning three years period. Our model reveals the significant difference of value structures among different player groups. Using the results of motivation modeling, we also predict and explain their diverse gameplay behaviors and provide a quantitative assessment of how the redesign of the game environment impacts players' behaviors.

研究の動機と目的

  • 勝利を超える人間の動機をモデル化し、達成、社会的、没入といったゲームプレイ動機に関する心理的理論を統合すること。
  • 環境のダイナミクスや人間のポリシーにアクセスできない状況でも、観測された軌道から多次元の報酬関数を推定する逆強化学習手法を開発すること。
  • パッチなどのゲームデザインの変更がプレイヤーの動機と行動に与える影響を、歴史的プレイデータを用いて定量的に評価すること。
  • 行動の多様性を説明できる、データ駆動的かつ解釈可能なプレイヤー価値構造のモデルを提供すること。

提案手法

  • MMBMは、達成、社会的、没入の3つのカテゴリーに分類された10種類の動機タイプの心理的分類に基づき、全報酬信号を個別の成分に分解する。
  • 各報酬成分は、オフポリシーQ学習を用いた深層Qネットワーク(DQN)を独立して使用して推定され、スケーラブルで効率的な学習が可能となる。
  • 逆強化学習問題は、観測された軌道を最もよく説明する価値構造(報酬成分の重み)を回復する線形計画問題として定式化される。
  • 観測された行動が推定された多次元報酬関数に関して最適であると仮定することで、反事実的行動やシミュレータへのアクセスが不要となる。
  • モデルは、World of Warcraft などの現実世界の複雑なゲームに適用可能な、歴史的データからの観測された状態-行動ペアのみに依存する。
  • 価値構造は、推定された多次元報酬関数下での観測軌道の尤度を最大化する線形計画問題を用いて学習される。

実験結果

リサーチクエスチョン

  • RQ1単一目的強化学習の枠組みを超えて、ゲームプレイにおける多面的で複雑な人間の動機をどのようにモデル化できるか?
  • RQ2環境のダイナミクスやポリシー関数にアクセスできない状況でも、逆強化学習が現実のプレイデータから複雑で多次元の報酬関数をどの程度正確に推定できるか?
  • RQ3プレイヤー集団ごとに価値構造はどのように異なるのか? また、ゲームアップデートへの反応として、時間経過とともにどのように変化するのか?
  • RQ4ゲームデザインの変更がプレイヤーの動機と行動に与える影響を、どのように定量的に評価できるか?

主な発見

  • MMBMは、World of Warcraft アバター歴史データセットにおいて、プレイヤー行動の予測で56.5%の正確性を達成し、大マージンQ学習(47.2%)とポリシーインピーリング(31.0%)を上回った。
  • モデルは、異なるプレイヤー集団において明確に異なる価値構造を回復し、プレイヤーがAdvancement、Competition、Teamworkといった動機をどのように優先しているかの違いを明らかにした。
  • 2008年11月に発売された「巫妖王の怒り」パッチの時期に、Advancement および Competition 動機が著しく増加したことが観察され、レベル上限の80への引き上げと新クラスの導入と相関していた。
  • モデルは、動機が相互に依存していることを示した:Advancement 動機の増加は、Teamwork 動機の減少と関連しており、プレイヤーの時間配分におけるトレードオフを示している。
  • 価値構造は時間経過とともに変化し、リリース後の初期年に、Relationship および Teamwork 動機が上昇した。これは、プレイヤーの関与度と社会的統合の増加を反映している。
  • モデルは、動機の重みの時間的シフトを分析することで、ゲームアップデートの影響を定量的に評価でき、ゲームデザインの評価に有効であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。