[論文レビュー] Bandit Models of Human Behavior: Reward Processing in Mental Disorders
本論文は、パーキンソン病、ADHD、薬物依存、慢性疼痛などの精神的疾患における報酬処理バイアスを、正の報酬・負の報酬および報酬履歴の重みを調整することでモデル化する、トムソンサンプリングのパrametric拡張を提案する。このモデルは、複数のデータセットにおいて標準的トムソンサンプリングを一貫して上回り、正の報酬環境および負の報酬環境の両方で性能が向上し、精神的障害における意思決定異常の統合的計算フレームワークを提供する。
Drawing an inspiration from behavioral studies of human decision making, we propose here a general parametric framework for multi-armed bandit problem, which extends the standard Thompson Sampling approach to incorporate reward processing biases associated with several neurological and psychiatric conditions, including Parkinson's and Alzheimer's diseases, attention-deficit/hyperactivity disorder (ADHD), addiction, and chronic pain. We demonstrate empirically that the proposed parametric approach can often outperform the baseline Thompson Sampling on a variety of datasets. Moreover, from the behavioral modeling perspective, our parametric framework can be viewed as a first step towards a unifying computational model capturing reward processing abnormalities across multiple mental conditions.
研究の動機と目的
- 神経疾患および精神的疾患で観察される報酬処理バイアスを捉える柔軟な計算モデルの開発を目的とする。
- 標準的トムソンサンプリングアルゴリズムを、パーキンソン病における否定的フィードバックへの感受性の増大といった疾患特異的学習バイアスを組み込むように拡張することを目的とする。
- 提案されたパラメトリックモデルが、ベースラインの標準的トムソンサンプリングと比較して、多腕バンディットタスクにおける性能を向上させるかどうかを評価することを目的とする。
- 一様なパラメトリックバンディットアプローチを用いて、多様な精神的状態における異常な報酬処理を統合的にモデル化するフレームワークを提供することを目的とする。
提案手法
- 本モデルは、ベルヌーイ的トムソンサンプリングを拡張し、到着する正の報酬および負の報酬に対する調整可能な重み、および報酬履歴情報に対する重みを導入する。
- 疾患特異的バイアスパrameterに基づいて、後方確信度の更新を変更するパラメトリック更新ルールを用いる。これにより、報酬の価値感度および記憶の減衰に対する感度を調整可能となる。
- フレームワークは、ADHD、薬物依存、パーキンソン病、アルツハイマー病などの複数のバリアントをサポートし、既知の行動バイアスを反映する異なるパラメータ設定で定義される。
- 本モデルは、正の報酬環境、負の報酬環境、および混合(通常)報酬環境という3つの報酬レジームで、標準的なUCIバンディットベンチマークデータセット上で訓練および評価される。
- パrameterチューニングは、臨床集団における行動障害の実証的観察、例えばパーキンソン病における肯定的結果からの学習障害に基づいて行われる。
- 性能評価は累積レグレットを用い、誤差率は総レグレットを反復回数で除算することで計算される。
実験結果
リサーチクエスチョン
- RQ1パラメトリック拡張されたトムソンサンプリングは、特定の精神的疾患に関連する報酬処理バイアスを効果的にモデル化できるか?
- RQ2提案されたモデルは、さまざまな報酬条件下で、標準的トムソンサンプリングを上回る性能を示すか?
- RQ3本モデルは、パーキンソン病における否定的フィードバックへの感受性の増大や、薬物依存における忘却機能の障害といった既知の行動表現型を再現できるか?
- RQ4同じパラメトリックフレームワークが、共通の計算的原則を用いて、多様な精神的疾患のモデル化をどの程度統合的に可能にするか?
主な発見
- 提案されたパラメトリックバンディットモデルは、すべてのデータセットおよび報酬環境で標準的トムソンサンプリングを一貫して上回り、評価のすべての設定で低い累積レグレットを示した。
- 正の報酬環境では、薬物依存(AD)およびADHDモデルが最良の性能を示し、4つのデータセットのうち2つでADが最小の誤差率を記録した。
- 負の報酬環境では、中程度(M)モデルが4つのデータセットのうち3つで最良の性能を示し、特定の疾患における否定的結果からの学習強化という臨床的観察と整合的であった。
- パーキンソン病(PD)および慢性疼痛(CP)モデルは、負の環境で優れた性能を示し、文献に示されるように、これらの疾患が否定的フィードバックに依存して学習することと整合的であった。
- アルツハイマー病(AZ)およびADHDモデルは、正の環境および負の環境の両方で上位にランクされた。これは、両方の報酬タイプからの学習が比較的保持されている可能性を示唆している。
- どのモデルもすべての設定で優位ではなかったため、異なる行動的および環境的文脈に応じて、最適なパラメータ設定が異なることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。