Skip to main content
QUICK REVIEW

[论文解读] An Image Based Visual Servo Approach with Deep Learning for Robotic Manipulation

Jingshu Liu, Yuan Li|arXiv (Cornell University)|Sep 17, 2019
Advanced Vision and Imaging参考文献 17被引用 7
一句话总结

本文提出了一种基于深度学习的基于图像的视觉伺服(IBVS)方法,该方法用双流卷积神经网络(CNN)替代了传统的方法中的特征提取和雅可比矩阵估计,直接将2D图像差异映射到4-DOF机器人机械臂的控制指令。该方法通过图像对(当前图像与目标图像)进行训练,学习从图像空间到任务空间的非线性映射,在实验中实现了精确的姿态对齐,而无需显式计算特征或解析雅可比矩阵。

ABSTRACT

Aiming at the difficulty of extracting image features and estimating the Jacobian matrix in image based visual servo, this paper proposes an image based visual servo approach with deep learning. With the powerful learning capabilities of convolutional neural networks(CNN), autonomous learning to extract features from images and fitting the nonlinear relationships from image space to task space is achieved, which can greatly facilitate the image based visual servo procedure. Based on the above ideas a two-stream network based on convolutional neural network is designed and the corresponding control scheme is proposed to realize the four degrees of freedom visual servo of the robot manipulator. Collecting images of observed target under different pose parameters of the manipulator as training samples for CNN, the trained network can be used to estimate the nonlinear relationship from 2D image space to 3D Cartesian space. The two-stream network takes the current image and the desirable image as inputs and makes them equal to guide the manipulator to the desirable pose. The effectiveness of the approach is verified with experimental results.

研究动机与目标

  • 解决传统基于图像的视觉伺服(IBVS)中手动图像特征提取和解析雅可比矩阵估计所面临的挑战。
  • 通过深度学习实现从2D图像空间到3D笛卡尔任务空间的非线性映射的端到端学习。
  • 设计一种双流CNN架构,以当前图像和目标图像作为输入,指导机器人机械臂的运动。
  • 消除在IBVS中对人工设计特征和解析模型的依赖,提升鲁棒性和自动化水平。
  • 在4-DOF机器人机械臂上通过实验验证该方法在姿态跟踪和对齐任务中的性能。

提出的方法

  • 设计了一种双流CNN,同时处理当前图像和目标图像作为输入。
  • 网络学习从当前图像与目标图像之间的差异到机器人所需关节速度指令的非线性映射。
  • 通过在不同机械臂位姿配置下采集的图像对进行训练,以模拟多样化的视觉观测。
  • 损失函数最小化预测图像与目标图像之间的像素级差异,引导机器人向目标位姿靠近。
  • 控制方案利用网络输出直接实时更新机器人的关节速度。
  • 该方法避免了显式计算图像雅可比矩阵,完全依赖CNN学习到的表示。

实验结果

研究问题

  • RQ1深度学习模型能否在无需手动设计特征的情况下,有效替代传统IBVS中的特征提取?
  • RQ2双流CNN在多大程度上能够学习2D图像空间与3D笛卡尔任务空间之间的非线性关系,以实现机器人操作?
  • RQ3所提出的方法在多大程度上减少了对解析雅可比矩阵估计的依赖?
  • RQ4网络能否在不同初始位姿下实现泛化,并在无需显式几何建模的情况下实现精确的姿态收敛?
  • RQ5与经典IBVS相比,端到端学习方法在收敛性和鲁棒性方面表现如何?

主要发现

  • 所提出的基于深度学习的IBVS方法成功实现了4-DOF视觉伺服,无需显式特征提取或雅可比矩阵计算。
  • 双流CNN能够学习将图像差异映射到控制指令,实现最小人工干预下的精确机器人姿态对齐。
  • 在多样化位姿配置下进行训练,使网络能够泛化到不同的初始位置和姿态。
  • 该方法在实验验证中表现出稳健性能,能够稳定收敛至期望的目标位姿。
  • 结果证实,通过CNN实现的端到端学习能够有效建模视觉伺服中复杂的非线性图像到任务空间映射。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。