Skip to main content
QUICK REVIEW

[论文解读] Structure Learning in Motor Control:A Deep Reinforcement Learning Model

Ari Weinstein, Matthew Botvinick|arXiv (Cornell University)|Jun 21, 2017
Motor Control and Adaptation参考文献 19被引用 8
一句话总结

本文提出一种基于循环神经网络(RNN)作为自适应前向模型的深度强化学习模型,以解释视觉运动适应中的运动结构学习。通过在结构化扰动(仅旋转 vs. 复杂变换)上进行训练,该模型复现了人类行为数据:当先前训练仅涉及旋转时,对60°旋转的适应速度更快,表明基于RNN的结构学习可实现运动控制中的高效元学习。

ABSTRACT

Motor adaptation displays a structure-learning effect: adaptation to a new perturbation occurs more quickly when the subject has prior exposure to perturbations with related structure. Although this `learning-to-learn' effect is well documented, its underlying computational mechanisms are poorly understood. We present a new model of motor structure learning, approaching it from the point of view of deep reinforcement learning. Previous work outside of motor control has shown how recurrent neural networks can account for learning-to-learn effects. We leverage this insight to address motor learning, by importing it into the setting of model-based reinforcement learning. We apply the resulting processing architecture to empirical findings from a landmark study of structure learning in target-directed reaching (Braun et al., 2009), and discuss its implications for a wider range of learning-to-learn phenomena.

研究动机与目标

  • 解释视觉运动适应中观察到的元学习形式——运动结构学习的计算机制。
  • 通过使用循环神经网络建模结构学习,弥合贝叶斯学习与深度学习在元学习视角上的差异。
  • 解释Braun等人(2009年)的实证发现,即当先前训练的扰动具有相同结构形式(如旋转)时,适应速度更快。
  • 证明RNN能够从经验中学习推断潜在任务结构,从而实现对新但结构相似任务的快速适应。
  • 通过角误差、轨迹偏差和目标可达性等指标,将模型性能与人类行为数据进行验证。

提出的方法

  • 将运动控制形式化为有限-horizon马尔可夫决策过程(MDP),包含状态、动作、转移动态和奖励函数。
  • 采用循环神经网络(RNN)作为预测性前向模型,整合历史动作-结果观测以估计未来状态。
  • 通过时间反向传播在2,000条随机游走数据的模拟轨迹上训练RNN,每条轨迹持续三秒。
  • 测试期间冻结RNN权重,并将RNN与规划器耦合,生成在纯60°视觉运动旋转下的抓取轨迹。
  • 比较两种训练条件下的模型性能:Rot(仅旋转)与Rot+(旋转外加剪切和缩放)。
  • 使用累积惩罚、角误差、速度和到目标区域的最小距离等指标评估性能,针对连续抓取进行评估。

实验结果

研究问题

  • RQ1基于RNN前向模型的深度强化学习模型能否复现人类视觉运动适应中观察到的结构学习效应?
  • RQ2先前暴露于结构一致的扰动(如仅旋转)如何影响对新且相似扰动的适应速度与准确性?
  • RQ3训练变换集合的复杂性(Rot vs. Rot+)在多大程度上影响模型推断和泛化潜在任务结构的能力?
  • RQ4RNN模型内部预测准确性是否与初始角误差和目标可达率等行为性能指标相关?
  • RQ5模型的轨迹可变性和收敛速度能否在定量上匹配Braun等人(2009年)的实证人类数据?

主要发现

  • 在训练期间,Rot模型的平均预测误差为每时间步0.002厘米,显著低于Rot+模型的每时间步0.03厘米。
  • 在测试中,Rot模型对60°旋转探测任务的适应更快更准确,累积惩罚更低,收敛速度更快,优于Rot+模型。
  • Rot模型始终在1.6厘米半径范围内达到目标区域,而Rot+模型表现出高度可变性,尽管初始角误差较低,却经常无法达到目标。
  • Rot模型表现出更低的轨迹方差,所有性能指标的置信区间更紧密,尤其在到目标区域的最小距离方面表现更优。
  • Rot+模型因约1.3的缩放因子而持续低估动作影响,导致持续的预测误差和较差的规划性能。
  • 该模型定性复现了人类行为数据:在Rot条件下适应更快、表现更好,证实训练中的结构一致性可提升元学习效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。