Skip to main content
QUICK REVIEW

[論文レビュー] Unified Models of Human Behavioral Agents in Bandits, Contextual Bandits and RL

Baihan Lin, Guillermo Cecchi|arXiv (Cornell University)|May 10, 2020
Advanced Bandit Algorithms Research参考文献 40被引用数 19
ひとこと要約

本論文は、臨床的知見に基づき、精神病的および神経疾患における報酬処理の二重ストリーム構造を模倣することで、マルチアームバンディット、コンテキストバンディット、強化学習の文脈における人間行動エージェントを統合的かつパrametricにモデル化するフレームワークを提案する。このモデルは、柔軟で生物学的に妥当な行動を示し、シミュレーションタスク、現実世界のギャンブルデータ、報酬の定常性が変化するパックマンゲームにおいても競争力のある性能を示す。

ABSTRACT

Artificial behavioral agents are often evaluated based on their consistent behaviors and performance to take sequential actions in an environment to maximize some notion of cumulative reward. However, human decision making in real life usually involves different strategies and behavioral trajectories that lead to the same empirical outcome. Motivated by clinical literature of a wide range of neurological and psychiatric disorders, we propose here a more general and flexible parametric framework for sequential decision making that involves a two-stream reward processing mechanism. We demonstrated that this framework is flexible and unified enough to incorporate a family of problems spanning multi-armed bandits (MAB), contextual bandits (CB) and reinforcement learning (RL), which decompose the sequential decision making process in different levels. Inspired by the known reward processing abnormalities of many mental disorders, our clinically-inspired agents demonstrated interesting behavioral trajectories and comparable performance on simulated tasks with particular reward distributions, a real-world dataset capturing human decision-making in gambling tasks, and the PacMan game across different reward stationarities in a lifelong learning setting.

研究の動機と目的

  • マルチアームバンディット、コンテキストバンディット、強化学習の文脈において、人間の意思決定行動を統合的に計算的にモデル化するフレームワークの開発。
  • 神経学的および精神病的疾患からの臨床的知見を、報酬処理の二重ストリーム機構を介して逐次的意思決定モデルに統合すること。
  • ADHD、うつ病、慢性疼痛などの多様な行動バイアスを捉えることのできる柔軟でパrametricなエージェント族の構築。
  • 実世界の人間意思決定データおよび報酬の定常性が変化する環境(例:パックマンゲーム)におけるモデルの性能評価。
  • 神経科学および精神病学分野で報酬処理の障害を解明するための計算的に解釈可能なツールの提供。

提案手法

  • 報酬信号を独立した二つのストリームに分割:正の報酬と負のペナルティ。それぞれに別個のパrameterを設定。
  • 報酬の正と負のストリームに対する重みを独立に調整できるように、コンテキストバンディット・トムソンサンプリング(CTS)を拡張。
  • エージェントは各アームの報酬期待値の事後分布を維持し、二重ストリーム入力を用いたベイジアン推論により更新。
  • 方策は事後分布からのサンプリングに基づき、正と負の報酬ストリームの相対的影響によって調整されたサンプリング分布を用いる。
  • 状態および文脈表現を適応させることで、MAB、CB、RLの文脈にこのフレームワークを適用。二重ストリーム報酬処理機構を維持。
  • 報酬の定常性が異なる4つの状況(定常、確率的スケーリング、確率的フリップ、非定常環境)で評価。

実験結果

リサーチクエスチョン

  • RQ1統合的パrametricモデルは、バンディット、コンテキストバンディット、強化学習の文脈で多様な人間行動戦略を捉えることができるか?
  • RQ2精神病的疾患に由来する二重ストリーム報酬処理機構は、非定常的かつ動的環境下での学習性能にどのように影響を与えるか?
  • RQ3このモデルは、慢性疼痛における回避行動やADHDにおける過活動といった臨床的観察された行動様式をどの程度再現できるか?
  • RQ4報酬のフリップやスケーリングが生じる環境では、標準的なベースラインと比較して二重ストリーム機構が性能向上に寄与するか?
  • RQ5このモデルは、健全な集団および障害を呈する集団における報酬処理を研究するための汎用的計算ツールとして機能できるか?

主な発見

  • 定常、確率的スケーリング、確率的フリップ、非定常環境の4つの報酬定常性シナリオすべてにおいて、分割モデルエージェントはLinUCB や SCTS といった標準ベースラインと同等の性能を達成した。
  • 報酬フリップシナリオでは、特定の精神的状態エージェント(例:ADHDに類似した高速スイッチング)が標準的な分割モデルを上回り、不安定な環境下での適応的行動という臨床的観察と整合した。
  • 慢性疼痛(CP)に類似したエージェントは、パックマンにおいても高い報酬が近くにあっても、常にゴーストを避ける極端な回避行動を示し、臨床的特徴の痛み関連行動抑制を反映した。
  • モデルは、異なる行動プロファイル(CPエージェントは生存を最優先、ADHDに類似したエージェントは急変する報酬構造で好調)を成功裏に再現した。
  • GitHubリポジトリの動画デモは、長期間の回避行動や報酬追求の減少といった臨床的期待と一致するエージェント行動を確認した。
  • 本フレームワークは、実世界のギャンブルデータやパックマンゲームを含む多様な環境においても頑健であった。これは、人間らしい意思決定モデル化への広範な適用可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。