[论文解读] A Story of Two Streams: Reinforcement Learning Models from Human Behavior and Neuropsychiatry
本文提出Split-QL,一种双流强化学习模型,通过使用独立的权重和折扣因子分别处理正向与负向奖励,受神经精神疾病中奖励处理偏倚的启发。该模型在模拟任务、爱荷华赌博任务以及奖励分布动态变化的终身Pac-Man环境中,均优于标准Q-learning、SARSA和Double Q-learning。
Drawing an inspiration from behavioral studies of human decision making, we propose here a more general and flexible parametric framework for reinforcement learning that extends standard Q-learning to a two-stream model for processing positive and negative rewards, and allows to incorporate a wide range of reward-processing biases -- an important component of human decision making which can help us better understand a wide spectrum of multi-agent interactions in complex real-world socioeconomic systems, as well as various neuropsychiatric conditions associated with disruptions in normal reward processing. From the computational perspective, we observe that the proposed Split-QL model and its clinically inspired variants consistently outperform standard Q-Learning and SARSA methods, as well as recently proposed Double Q-Learning approaches, on simulated tasks with particular reward distributions, a real-world dataset capturing human decision-making in gambling tasks, and the Pac-Man game in a lifelong learning setting across different reward stationarities.
研究动机与目标
- 开发一种更具灵活性且生物学上更合理的强化学习框架,以捕捉神经精神疾病中观察到的人类奖励处理偏倚。
- 通过为正向与负向奖励分别建模处理流并使用独立参数,扩展标准Q-learning。
- 评估该双流方法在非平稳及具有临床相关性的决策环境中的性能提升。
- 探讨ADHD、抑郁和成瘾等疾病中观察到的奖励处理失衡的计算影响。
- 提供一个统一的计算模型,用于在单一框架中研究健康与障碍状态下的奖励处理。
提出的方法
- Split-QL模型将奖励信号拆分为两个独立流:正向奖励和负向奖励,每一流使用独立的权重参数。
- 每一流对过去奖励应用独立的折扣因子,从而实现对正向与负向经验的不同记忆保留。
- Q值更新规则被修改,为每个状态-动作对计算两个独立的Q值(每一流一个),再将它们合并为最终Q值。
- 使用修改后的Q-learning更新规则进行训练,为每一流维护独立的目标网络或更新机制,以确保稳定性。
- 该框架支持多种具有临床启发的参数配置,例如对负向奖励的敏感度增强(帕金森病样)或对过去奖励的遗忘能力受损(成瘾样)。
- 实验在合成MDP、爱荷华赌博任务(IGT)以及具有随机奖励变化的终身Pac-Man游戏中进行,以测试其适应能力。
实验结果
研究问题
- RQ1是否双流强化学习模型通过分别处理正向与负向奖励,能在非平稳及具有临床相关性的环境中优于标准Q-learning?
- RQ2不同奖励处理偏倚(如对负向奖励的敏感度增强或对过去奖励的折扣能力受损)如何影响学习性能与适应能力?
- RQ3Split-QL在多大程度上能捕捉并再现ADHD、抑郁或慢性疼痛等神经精神疾病中观察到的行为模式?
- RQ4在奖励分布随时间变化的终身学习环境中,该模型是否表现出更优的适应能力?
- RQ5该模型的性能是否可调节以反映特定临床表型,例如慢性疼痛中的回避行为或成瘾中的风险寻求行为?
主要发现
- 在具有非独立同分布奖励分布的合成MDP上,Split-QL始终优于标准Q-learning、SARSA和Double Q-learning。
- 在爱荷华赌博任务(IGT)上,该真实世界人类赌博决策数据集显示,使用临床启发参数的Split-QL在性能上匹配或超过人类表现,并优于基线方法。
- 在具有随机奖励变化的终身Pac-Man环境中,Split-QL在所有四种平稳性情景(奖励流的随机静音、缩放和翻转)中均展现出更优的适应能力与更高的平均最终得分。
- 在奖励翻转情景中,某些心理代理变体(特别是ADHD样代理)甚至超越了标准Split-QL,反映出在高变异性环境中真实世界的行为优势。
- CP(慢性疼痛)样代理表现出极端回避行为,尽管奖励较低也持续躲避幽灵,与临床中慢性疼痛患者优先考虑生存而非奖励收集的特征一致。
- 该模型的灵活性使其能够模拟多种临床表型,包括慢性疼痛中的回避行为和ADHD中的快速注意力切换,表明其作为精神病理学建模计算工具的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。