Skip to main content
QUICK REVIEW

[论文解读] Bandit Models of Human Behavior: Reward Processing in Mental Disorders

Djallel Bouneffouf, Irina Rish|arXiv (Cornell University)|Jun 7, 2017
Advanced Bandit Algorithms Research参考文献 15被引用 4
一句话总结

本文提出了一种泰普森采样(Thompson Sampling)的参数化扩展,通过调整正/负奖励及奖励历史的权重,对帕金森病、注意力缺陷多动障碍(ADHD)、成瘾和慢性疼痛等精神障碍中的奖励处理偏倚进行建模。该模型在多个数据集上持续优于标准泰普森采样,在正负奖励环境中均表现出更优性能,并为研究精神疾病中的决策异常提供了一个统一的计算框架。

ABSTRACT

Drawing an inspiration from behavioral studies of human decision making, we propose here a general parametric framework for multi-armed bandit problem, which extends the standard Thompson Sampling approach to incorporate reward processing biases associated with several neurological and psychiatric conditions, including Parkinson's and Alzheimer's diseases, attention-deficit/hyperactivity disorder (ADHD), addiction, and chronic pain. We demonstrate empirically that the proposed parametric approach can often outperform the baseline Thompson Sampling on a variety of datasets. Moreover, from the behavioral modeling perspective, our parametric framework can be viewed as a first step towards a unifying computational model capturing reward processing abnormalities across multiple mental conditions.

研究动机与目标

  • 开发一种灵活的计算模型,以捕捉神经和精神疾病中观察到的奖励处理偏倚。
  • 扩展标准泰普森采样算法,纳入特定疾病的学习偏倚,例如帕金森病中对负面反馈的敏感性增强。
  • 评估所提出的参数化模型在多臂老虎机任务中是否优于基线泰普森采样。
  • 提供一个统一框架,通过单一参数化老虎机方法,对多种精神障碍中的异常奖励处理进行建模。

提出的方法

  • 该模型通过引入对正负奖励输入以及历史奖励信息的可调权重,扩展了伯努利泰普森采样。
  • 采用参数化更新规则,基于特定疾病的偏倚参数修改后验信念更新,从而调节对奖励效价和记忆衰减的敏感性。
  • 该框架支持多种变体(如ADHD、成瘾、帕金森病、阿尔茨海默病),每种变体由反映已知行为偏倚的独特参数设置定义。
  • 模型在标准UCI老虎机基准数据集上进行训练和评估,涵盖三种奖励环境:仅正向奖励、仅负向奖励和混合(正常)奖励环境。
  • 参数调优基于临床人群中行为缺陷的经验观察,例如帕金森病患者从正向结果中学习能力受损。
  • 性能通过累积遗憾(cumulative regret)评估,误差率计算为总遗憾除以迭代次数。

实验结果

研究问题

  • RQ1参数化扩展的泰普森采样能否有效建模与特定精神障碍相关的奖励处理偏倚?
  • RQ2在不同奖励条件下,所提出的模型是否在老虎机学习任务中优于标准泰普森采样?
  • RQ3该模型能否复现已知的行为表型,例如帕金森病中对负面反馈的敏感性增强,或成瘾中遗忘能力受损?
  • RQ4同一参数化框架在多大程度上能通过共享的计算原理,统一建模多种精神障碍?

主要发现

  • 所提出的参数化老虎机模型在所有数据集和奖励环境中均持续优于标准泰普森采样,所有评估设置下累积遗憾更低。
  • 在正向奖励环境中,成瘾(AD)和ADHD模型表现最佳,AD在四个数据集中的两个中取得了最低误差率。
  • 在负向奖励环境中,中等(M)模型在四个数据集中的三个表现最佳,与某些疾病中从负向结果中学习能力增强的临床观察一致。
  • 帕金森病(PD)和慢性疼痛(CP)模型在负向环境中表现更优,与文献中其依赖负向反馈进行学习的结论一致。
  • 阿尔茨海默病(AZ)和ADHD模型在正向和负向环境中均位列顶尖,表明其对两类奖励的处理能力相对保留。
  • 无单一模型在所有设置中占优,表明不同参数配置在不同行为和环境背景下具有最优表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。