Skip to main content
QUICK REVIEW

[论文解读] Generating Goal-Directed Visuomotor Plans Based on Learning Using a Predictive Coding-type Deep Visuomotor Recurrent Neural Network Model

Minkyu Choi, Takazumi Matsumoto|arXiv (Cornell University)|Mar 7, 2018
Visual perception and processing mechanisms参考文献 17被引用 5
一句话总结

该论文提出了一种基于预测编码的深度视觉运动循环神经网络(P-DVMRNN),通过在训练过程中从视觉-本体感觉序列推断意图状态,学习目标导向的视觉运动规划。该模型通过最小化预测误差,能够在未学习的目标状态下实现泛化,成功在真实机器人实验中生成多步规划,但其性能严重依赖于充足的训练数据,并受限于低分辨率视觉输入。

ABSTRACT

The current paper presents how a predictive coding type deep recurrent neural networks can generate vision-based goal-directed plans based on prior learning experience by examining experiment results using a real arm robot. The proposed deep recurrent neural network learns to predict visuo-proprioceptive sequences by extracting an adequate predictive model from various visuomotor experiences related to object-directed behaviors. The predictive model was developed in terms of mapping from intention state space to expected visuo-proprioceptive sequences space through iterative learning. Our arm robot experiments adopted with three different tasks with different levels of difficulty showed that the error minimization principle in the predictive coding framework applied to inference of the optimal intention states for given goal states can generate goal-directed plans even for unlearned goal states with generalization. It was, however, shown that sufficient generalization requires relatively large number of learning trajectories. The paper discusses possible countermeasure to overcome this problem.

研究动机与目标

  • 开发一种可学习的、端到端的深度神经网络,用于基于预测编码原理的目标导向视觉运动规划。
  • 使机器人能够推断生成期望感知结果的意图状态,即使在未学习的目标状态下亦可实现。
  • 研究训练数据量对视觉运动规划泛化性能的影响。
  • 评估模型从推断的意图状态生成长时程视觉-本体感觉序列的能力。

提出的方法

  • P-DVMRNN 模型采用深度循环架构,通过最小化预测误差,学习从意图状态(内部神经状态)到视觉-本体感觉序列的因果映射。
  • 意图状态在训练过程中自我确定,并编码为 RNN 的初始隐藏状态,使网络能够推断目标导向行为的内部表征。
  • 该模型在离线状态下,基于多个任务中不同机器人轨迹的像素级视觉与关节角度的同步序列进行训练。
  • 规划的推理过程涉及反转学习到的映射:给定目标状态(例如目标视觉帧),模型推断出能产生该结果的意图状态。
  • 该框架使用误差最小化方法,迭代优化意图状态估计,通过预测编码实现目标导向规划。
  • 在闭环(带反馈)和开环(无反馈)设置下,评估了一步和多步预测,以衡量规划精度。

实验结果

研究问题

  • RQ1基于预测编码的深度 RNN 是否能够学习推断出从未学习的目标状态生成期望视觉-本体感觉结果的意图状态?
  • RQ2训练数据量如何影响模型在生成新型视觉运动规划时的泛化能力?
  • RQ3在无实时反馈的情况下,该模型在多大程度上能够准确生成视觉与运动序列的多步预测?
  • RQ4图像分辨率和感官保真度在复杂操作任务(如物体抓取)中的成功中起到何种影响?
  • RQ5该模型能否在不同难度的任务之间实现泛化,包括需要精确空间控制的任务?

主要发现

  • P-DVMRNN 通过预测误差最小化推断意图状态,成功为未学习的目标状态生成了目标导向的视觉运动规划,展示了在任务间的泛化能力。
  • 在第一个任务(抓取)中,模型在达到目标状态方面的成功率为 75%,但随着训练数据减少,成功率显著下降。
  • 在物体操作任务中,在严格抓取条件下成功率为 48%,当允许抓取位置最多偏差 3 像素(3.9 厘米)时,成功率提升至 71%。
  • 开环预测(无反馈)显著优于闭环预测,允许 3 像素抓取误差时,成功率达到 93%,而闭环条件下为 71%。
  • 该模型在生成视觉和运动模态的远期预测(多步前瞻)方面表现出色,表明其具备强大的内部规划能力。
  • 研究发现,训练数据不足会严重限制泛化能力,并建议采用变分贝叶斯正则化作为提升数据效率的潜在解决方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。