Skip to main content
QUICK REVIEW

[论文解读] Planning Robot Motion using Deep Visual Prediction

Meenakshi Sarkar, Prabhu Pradhan|arXiv (Cornell University)|Jun 24, 2019
Human Pose and Action Recognition参考文献 22被引用 7
一句话总结

本文提出PROM-Net,一种轻量级、无监督的深度学习框架,通过第一人称机器人视角的原始视频帧预测未来机器人运动。该框架在新型乐高(LEGO)数据集上进行训练,涵盖多样的光照和地形条件,能够实现高精度的10帧未来预测,适用于移动平台的实时运动规划。在PSNR和SSIM指标上优于全连接LSTM基线模型,同时在动态环境中实现了基于视觉的模型预测控制。

ABSTRACT

In this paper, we introduce a novel framework that can learn to make visual predictions about the motion of a robotic agent from raw video frames. Our proposed motion prediction network (PROM-Net) can learn in a completely unsupervised manner and efficiently predict up to 10 frames in the future. Moreover, unlike any other motion prediction models, it is lightweight and once trained it can be easily implemented on mobile platforms that have very limited computing capabilities. We have created a new robotic data set comprising LEGO Mindstorms moving along various trajectories in three different environments under different lighting conditions for testing and training the network. Finally, we introduce a framework that would use the predicted frames from the network as an input to a model predictive controller for motion planning in unknown dynamic environments with moving obstacles.

研究动机与目标

  • 开发一种轻量级、无监督的视觉预测框架,用于未知动态环境中的机器人运动规划。
  • 构建一个新型的第一人称机器人视频数据集,记录乐高Mindstorms机器人在不同光照和地形条件下的运动,用于训练与评估。
  • 通过将预测的视频帧转化为可执行的控制策略,利用模型预测控制(MPC)实现在移动平台上的实时运动规划。
  • 克服传统视觉方法(如视觉伺服控制)在高速、动态场景中存在移动障碍物时的局限性。
  • 设计一种无需人工监督的系统,仅使用原始视频数据和端到端训练进行学习。

提出的方法

  • PROM-Net采用带有残差连接的卷积编码器-解码器架构,以无监督方式从10帧输入帧中预测10帧未来视频帧。
  • 网络通过像素级重建损失(L1/L2)和对抗性损失进行训练,以提升预测结果的感知质量并减少模糊。
  • 使用两台乐高Mindstorms机器人在四种不同环境中采集了定制的机器人数据集:室内日光、室内人工光源、户外阳光照射的路面,以及有动态障碍物的黄昏跑道。
  • 通过定义一种奖励函数,将预测帧整合进模型预测控制器(MPC)中,该函数通过惩罚预测帧中靠近障碍物的区域来引导控制策略。
  • 使用RMSProp进行训练,批量大小为64,固定学习率为0.001,确保在低算力平台上的高效部署。
  • 该方法支持灰度和RGB输入,仅需对网络架构进行微小调整,确保对真实世界机器人传感器的适应性。

实验结果

研究问题

  • RQ1轻量级、无监督的深度学习模型能否以足够精度从原始第一人称视频帧中预测未来机器人运动,以支持运动规划?
  • RQ2与标准LSTM基线模型相比,PROM-Net在未见轨迹和环境条件下的泛化能力如何?
  • RQ3PROM-Net生成的预测视频帧在多大程度上可用于引导动态、障碍物密集环境中的模型预测控制器?
  • RQ4环境变化性(光照、地形、阴影)对真实世界机器人场景中视觉运动预测性能有何影响?
  • RQ5仅使用预测帧和基于障碍物接近度的奖励函数,能否有效训练基于视觉的MPC系统?

主要发现

  • 在模拟和真实世界数据中,PROM-Net在所有10帧预测中均优于全连接LSTM网络,PSNR和SSIM指标更高。
  • 该网络在未见轨迹上表现出强大的泛化能力,成功预测了训练数据中未出现的运动场景,如图6所示。
  • 在真实世界的ARM数据集上,PROM-Net在10帧预测中平均SSIM值超过0.75,表明其运动预测具有高感知质量。
  • 尽管由于回归损失导致部分模糊,但预测帧仍足以推断未来物体的运动方向,这对路径规划至关重要。
  • 将预测帧集成到模型预测控制器中,成功实现了有效避障,奖励函数成功惩罚了朝向预测障碍物的轨迹。
  • 由于其轻量级架构,该框架可部署于移动平台,即使在边缘设备上也能实现实时推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。