[论文解读] Hierarchical Reinforcement Learning as a Model of Human Task Interleaving
本文提出分层强化学习(HRL)作为人类任务交错的计算模型,其中高层监督机制利用任务特定的低层强化学习智能体的价值估计,决定何时以及切换到哪个任务。该模型在预测个体任务顺序序列和状态访问模式方面优于短视基线模型,表明HRL能够捕捉在复杂、延迟奖励和成本条件下的自适应、目标导向的切换行为。
How do people decide how long to continue in a task, when to switch, and to which other task? Understanding the mechanisms that underpin task interleaving is a long-standing goal in the cognitive sciences. Prior work suggests greedy heuristics and a policy maximizing the marginal rate of return. However, it is unclear how such a strategy would allow for adaptation to everyday environments that offer multiple tasks with complex switch costs and delayed rewards. Here we develop a hierarchical model of supervisory control driven by reinforcement learning (RL). The supervisory level learns to switch using task-specific approximate utility estimates, which are computed on the lower level. A hierarchically optimal value function decomposition can be learned from experience, even in conditions with multiple tasks and arbitrary and uncertain reward and cost structures. The model reproduces known empirical effects of task interleaving. It yields better predictions of individual-level data than a myopic baseline in a six-task problem (N=211). The results support hierarchical RL as a plausible model of task interleaving.
研究动机与目标
- 开发一种计算上可行的人类任务交错模型,以解释延迟奖励、切换成本以及复杂任务结构的影响。
- 探究分层强化学习(HRL)是否能够解释多任务处理中的自适应监督控制,超越贪婪或短视策略。
- 评估HRL在六任务交错任务中,相较于短视基线,是否能更准确预测个体层面的任务顺序与状态访问模式。
- 考察分层价值分解在实现对未经历的新任务实例泛化以及提升对不确定性鲁棒性方面的作用。
提出的方法
- 采用两级HRL架构:低层强化学习智能体为每类任务(如写作、浏览)维护价值函数,而高层智能体根据低层提供的效用估计选择关注的任务实例。
- 高层智能体利用时间抽象在可变持续时间的子任务上做决策,相比扁平化强化学习,显著降低计算复杂度。
- 通过经验进行时序差分学习更新价值函数,使模型能够在奖励不确定且延迟的情况下学习最优切换策略。
- 切换成本被建模为任务回忆努力的函数,模型使用折扣因子以平衡即时奖励与未来奖励之间的权衡。
- 通过基于梯度的优化程序在训练和测试试验上对每位参与者的模型参数(折扣因子、切换成本、任务特定奖励)进行拟合。
- 性能通过任务顺序误差、状态访问直方图交集以及参与者间复制动作的比例进行评估。
实验结果
研究问题
- RQ1分层强化学习(HRL)是否能比短视的贪婪策略更准确地解释人类任务交错行为?
- RQ2HRL在多大程度上能复现人类参与者在任务顺序选择与状态访问频率上的经验模式?
- RQ3HRL的分层价值分解是否能有效支持在不确定性和延迟奖励环境下的多任务规划?
- RQ4HRL在多大程度上能将任务类型知识泛化到此前未经历的新任务实例?
主要发现
- HRL在预测任务顺序序列方面显著优于随机基线模型,中位数任务顺序误差为26.21,而随机模型为177.90(p < 0.001)。
- HRL与人类参与者状态访问模式的直方图交集达0.93,优于短视模型(0.88)和随机模型(0.81)。
- 模型预测的切换模式与人类行为高度一致,在子任务边界处重现了阶梯状的访问模式,表明与人类子任务分割具有对齐性。
- 参数拟合结果显示,学习到的模型参数在保留的测试试验上具有良好泛化能力,训练数据中复制动作的比例从第1轮的0.64提升至第60轮的0.73。
- 尽管存在部分参数可靠性问题(如折扣因子的标准差为0.23),但模型整体拟合效果良好,HRL与随机模型之间差异显著(p < 0.001)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。