[论文解读] Modeling Human Exploration Through Resource-Rational Reinforcement Learning
该论文提出资源理性强化学习(RR-RL²),一种元学习算法,通过在性能与最短描述长度(比特数)之间权衡来优化探索。该方法在建模人类行为方面优于标准方法(如Thompson采样和UCB),可通过调整描述长度来捕捉发展性和临床性探索变化,并为人工智能代理提供一种生物上合理的类人探索框架。
Equipping artificial agents with useful exploration mechanisms remains a challenge to this day. Humans, on the other hand, seem to manage the trade-off between exploration and exploitation effortlessly. In the present article, we put forward the hypothesis that they accomplish this by making optimal use of limited computational resources. We study this hypothesis by meta-learning reinforcement learning algorithms that sacrifice performance for a shorter description length (defined as the number of bits required to implement the given algorithm). The emerging class of models captures human exploration behavior better than previously considered approaches, such as Boltzmann exploration, upper confidence bound algorithms, and Thompson sampling. We additionally demonstrate that changing the description length in our class of models produces the intended effects: reducing description length captures the behavior of brain-lesioned patients while increasing it mirrors cognitive development during adolescence.
研究动机与目标
- 探究人类探索行为是否源于对有限计算资源的最优利用。
- 开发一种强化学习框架,通过以性能换取更短的算法描述长度来反映认知资源限制。
- 检验在模型中调整描述长度是否能复现人类探索行为在发育和脑损伤情况下的观察变化。
- 提供一个统一且生物上合理的类人探索解释框架,其适用范围超越标准的老虎机模型。
提出的方法
- 通过在描述长度(实现算法所需的比特数)约束下优化性能,元学习强化学习策略。
- 采用信息论正则化方法,在期望回报与算法复杂度之间取得平衡,灵感源自最小描述长度(MDL)原则。
- 通过元强化学习训练模型,其中策略在具有已知先验的老虎机任务分布上进行优化。
- 将策略表示为循环神经网络,其描述长度通过编码其权重和结构所需的比特数来衡量。
- 调整描述长度约束以模拟认知资源限制,从而与人类及患者的行为进行比较。
- 将该模型应用于重新分析三组心理学研究中关于人类在双臂老虎机任务中的决策行为数据。
实验结果
研究问题
- RQ1与Thompson采样或UCB等标准启发式方法相比,资源理性强化学习模型是否能更好地解释人类探索行为?
- RQ2在模型中降低强化学习算法的描述长度,是否能复现脑区损伤患者中观察到的探索模式?
- RQ3增加模型的描述长度是否能模拟青少年发育过程中从随机探索到定向探索的转变?
- RQ4单一元学习算法能否同时捕捉人类探索在多种认知情境下的定性和定量特征?
主要发现
- RR-RL²在解释双臂老虎机任务中人类选择行为方面,无论在定性还是定量层面,均优于Thompson采样、UCB及其混合模型。
- 降低RR-RL²的描述长度,可产生与前额叶皮层损伤患者观察到的探索模式一致的结果,表明战略探索能力受损。
- 增加RR-RL²的描述长度可复现青少年发育过程中从随机探索到定向探索的转变,提示认知控制能力提升。
- 该模型在不同任务结构下表现稳健,表明低描述长度算法具有强正则化作用,促进泛化能力。
- 该模型的预测与三组心理学研究的实证数据高度一致,验证了其捕捉真实人类行为的能力。
- 该框架表明,最短描述长度不仅是一种生物约束,更是一种功能性特征,可支持鲁棒且通用的探索策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。