[论文解读] Value-of-Information based Arbitration between Model-based and Model-free Control
本文提出了一种基于信息价值(VoI)的仲裁机制,通过动态切换模型基础强化学习与无模型强化学习,在计算效率与适应性之间取得平衡。通过将Q值方差的不确定性作为VoI信号,当代理处于不确定状态时优先采用模型基础规划,随着信心增长则转为高效的无模型学习,其在技能习得任务中的表现优于标准Q-learning和使用经验回放的Q-learning。
There have been numerous attempts in explaining the general learning behaviours using model-based and model-free methods. While the model-based control is flexible yet computationally expensive in planning, the model-free control is quick but inflexible. The model-based control is therefore immune from reward devaluation and contingency degradation. Multiple arbitration schemes have been suggested to achieve the data efficiency and computational efficiency of model-based and model-free control respectively. In this context, we propose a quantitative 'value of information' based arbitration between both the controllers in order to establish a general computational framework for skill learning. The interacting model-based and model-free reinforcement learning processes are arbitrated using an uncertainty-based value of information. We further show that our algorithm performs better than Q-learning as well as Q-learning with experience replay.
研究动机与目标
- 解决技能习得过程中模型基础规划的计算成本与无模型学习的样本低效性之间的权衡问题。
- 基于定量的成本-收益分析,开发一种生物上合理的、在模型基础与无模型控制器之间实现动态仲裁的机制。
- 使代理能够随着技能熟练度的提升,从目标导向的灵活规划过渡到习惯性的快速执行。
- 通过验证行为现象,特别是传感器运动技能学习中的Fitts三阶段学习模型,来检验该框架的有效性。
提出的方法
- 代理在两个阶段运行:'规划'(模型基础)和'执行'(无模型基础),仲裁基于信息价值(VoI)度量。
- VoI计算公式为 $ VoI(s,a) = C_{(s,a)} / (\tau(s) + \rho) $,其中 $ C_{(s,a)} $ 为状态-动作对 $ (s,a) $ 的Q值方差,$ \tau(s) $ 为状态 $ s $ 下所有动作的Q值方差。
- 仅当VoI超过阈值时触发模型基础规划,表示高不确定性;否则使用无模型Q-learning。
- 模型基础规划采用深度受限的价值迭代与前向搜索,当深度为零时转为离策略Q-learning。
- 该框架在早期训练中学习环境动态(转移概率),从而增强对奖励贬值和情境变化的鲁棒性。
- 仲裁机制随时间演变:模型基础控制在早期(200–300个回合)占主导,约400个回合后逐渐让位于无模型控制。
实验结果
研究问题
- RQ1如何设计一种在模型基础与无模型强化学习之间实现动态仲裁的机制,以平衡计算成本与学习效率?
- RQ2基于Q值方差的信息价值(VoI)度量在多大程度上能够实现规划与反应行为之间的最优切换?
- RQ3所提出的框架是否能够再现行为研究中观察到的技能学习三阶段进展(认知阶段、联结阶段、运动阶段)?
- RQ4该混合模型在样本效率与收敛速度方面是否优于标准Q-learning和使用经验回放的Q-learning?
主要发现
- 基于VoI的仲裁机制在约400个训练回合内成功实现从模型基础控制到无模型控制的过渡,与Fitts理论中从目标导向到习惯性行为的转变相吻合。
- 模型基础评估在约400回合后降至零,表明无模型控制器已完全接管,其计算效率高,适用于成熟技能的执行。
- 该代理在性能上优于标准Q-learning和使用经验回放的Q-learning,证明了其在学习效率与收敛性方面的提升。
- 该框架在早期训练中学习了转移概率(世界模型),从而增强了对奖励贬值和情境退化问题的鲁棒性。
- VoI度量随学习进展而增加,反映出不确定性降低,引导代理在信心充足时切换至更快的无模型执行。
- 在认知阶段(前200–300回合),模型基础控制器保持主导地位,支持在不确定环境中实现数据高效且适应性强的规划。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。