[论文解读] Unified Models of Human Behavioral Agents in Bandits, Contextual Bandits and RL
本文提出了一种统一的、参数化的框架,用于在多臂赌博机、上下文赌博机和强化学习中建模人类行为代理,通过将奖励处理划分为正向和负向两个流,受精神疾病和神经系统疾病临床研究发现的启发。该模型在模拟任务、现实世界赌博数据以及奖励非平稳性变化的PacMan游戏中,展现出灵活且具有神经生物学合理性的行为,且性能与基线模型相当。
Artificial behavioral agents are often evaluated based on their consistent behaviors and performance to take sequential actions in an environment to maximize some notion of cumulative reward. However, human decision making in real life usually involves different strategies and behavioral trajectories that lead to the same empirical outcome. Motivated by clinical literature of a wide range of neurological and psychiatric disorders, we propose here a more general and flexible parametric framework for sequential decision making that involves a two-stream reward processing mechanism. We demonstrated that this framework is flexible and unified enough to incorporate a family of problems spanning multi-armed bandits (MAB), contextual bandits (CB) and reinforcement learning (RL), which decompose the sequential decision making process in different levels. Inspired by the known reward processing abnormalities of many mental disorders, our clinically-inspired agents demonstrated interesting behavioral trajectories and comparable performance on simulated tasks with particular reward distributions, a real-world dataset capturing human decision-making in gambling tasks, and the PacMan game across different reward stationarities in a lifelong learning setting.
研究动机与目标
- 开发一个统一的计算框架,用于在多臂赌博机、上下文赌博机和强化学习中建模人类行为决策。
- 通过双流奖励处理,将神经精神疾病临床发现融入序列决策模型。
- 构建一个灵活的参数化代理家族,以捕捉诸如注意力缺陷多动障碍(ADHD)、抑郁和慢性疼痛等行为偏差。
- 在真实世界人类决策数据和复杂环境(如PacMan游戏)中,于奖励非平稳条件下评估模型性能。
- 为神经科学和精神病学提供一种计算上可解释的工具,用于研究奖励处理障碍。
提出的方法
- 该模型将奖励信号划分为两个独立的流:正向奖励和负向惩罚,每个流使用独立的参数进行处理。
- 将上下文 Thompson 采样(CTS)扩展,以允许对正向和负向奖励流的权重进行独立调节。
- 代理为每根臂维护奖励期望的后验分布,通过贝叶斯推断结合双流输入进行更新。
- 策略基于从后验分布中采样选择动作,其中采样分布受正向和负向奖励流相对影响的调制。
- 通过调整上下文和状态表示,在MAB、CB和RL设置中应用该框架,同时保持双流奖励机制不变。
- 在四种奖励平稳性条件下评估模型:平稳、随机缩放、随机翻转和非平稳环境。
实验结果
研究问题
- RQ1统一的参数化模型能否在多臂赌博机、上下文赌博机和强化学习中捕捉多样化的人类行为策略?
- RQ2受精神疾病启发的双流奖励处理机制,在非平稳和动态环境中如何影响学习性能?
- RQ3该模型在多大程度上能复现临床观察到的行为,如慢性疼痛中的回避行为或ADHD中的多动行为?
- RQ4与标准基线相比,双流机制是否在奖励翻转或缩放环境中提升性能?
- RQ5该模型能否作为研究健康人群和障碍人群奖励处理的一般性计算工具?
主要发现
- 在所有四种奖励平稳性场景——平稳、随机缩放、随机翻转和非平稳环境中,分割模型代理在性能上与LinUCB和SCTS等标准基线相当。
- 在奖励翻转场景中,某些心理代理(如ADHD样快速切换)的表现优于标准分割模型,与临床观察中不稳定环境中适应性行为一致。
- 慢性疼痛(CP)样代理在PacMan中表现出极端回避行为,尽管附近有高奖励,仍持续躲避幽灵,反映出临床中与疼痛相关的抑制行为特征。
- 该模型成功复现了不同的行为表型:CP代理优先考虑生存而非奖励,而ADHD样代理在快速变化的奖励结构中表现优异。
- GitHub仓库中的视频演示证实,代理行为与临床预期一致,如长期回避和减少奖励追逐。
- 该框架在多样化环境中表现出鲁棒性,包括现实世界赌博数据和PacMan游戏,表明其在建模类人决策方面的广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。