Skip to main content
QUICK REVIEW

[论文解读] Learning Humanoid Robot Motions Through Deep Neural Networks

Luckeciano C. Melo, Marcos R. O. A. Máximo|arXiv (Cornell University)|Jan 2, 2019
Robotic Locomotion and Control参考文献 16被引用 8
一句话总结

本文提出一种深度神经网络框架,可直接从关节角度数据中学习并复制人形机器人动作(如行走和踢球),而无需对运动结构做先验假设。该方法成功地以相同网络架构和超参数,模仿了其他团队的复杂动作(包括DRL优化的踢球动作),在仿真中展现出良好的可迁移性与高保真度复制能力。

ABSTRACT

Controlling a high degrees of freedom humanoid robot is acknowledged as one of the hardest problems in Robotics. Due to the lack of mathematical models, an approach frequently employed is to rely on human intuition to design keyframe movements by hand, usually aided by graphical tools. In this paper, we propose a learning framework based on neural networks in order to mimic humanoid robot movements. The developed technique does not make any assumption about the underlying implementation of the movement, therefore both keyframe and model-based motions may be learned. The framework was applied in the RoboCup 3D Soccer Simulation domain and promising results were obtained using the same network architecture for several motions, even when copying motions from another teams.

研究动机与目标

  • 开发一种通用的人形机器人动作学习框架,不假设运动结构的底层形式。
  • 通过在关节轨迹数据上使用监督学习,实现对多样化动作(包括关键帧动作与基于模型的动作)的模仿。
  • 将其他团队的高性能动作直接迁移到代理的动作库中,无需逆向工程其控制策略。
  • 建立神经网络对运动的表示形式,作为未来基于强化学习的策略优化的潜在起点。
  • 在逼真的仿真环境中,验证该框架在不同类型动作及外部动作来源下的泛化能力。

提出的方法

  • 从现有关键帧动作或动作捕捉数据中,以离散时间步长采集关节角度轨迹。
  • 使用监督学习在采集的轨迹数据上,训练前馈深度神经网络,将时间点映射为关节角度配置。
  • 在数据采集过程中,使用三次样条插值从关键帧步长生成平滑的关节轨迹。
  • 在多个动作类型(如行走、踢球)上应用相同的固定网络架构和超参数,以评估泛化能力。
  • 以开环方式执行学习到的动作,使用关节控制器跟踪网络预测的关节位置。
  • 使用修改后的RoboCup 3D仿真服务器,实时提取其他团队代理的关节值以实现模仿。

实验结果

研究问题

  • RQ1单一深度神经网络架构是否能泛化到多样化的人形机器人动作(如行走和踢球)?
  • RQ2在无法访问其内部控制逻辑的情况下,神经网络在多大程度上能准确模仿其他团队的复杂、高维动作?
  • RQ3在开环执行下,尤其在动态和非理想条件下,学习到的动作在仿真中的表现如何?
  • RQ4学习到的神经运动是否可作为端到端强化学习策略的可行初始化?
  • RQ5当模仿使用先进优化或强化学习技术的代理所生成的动作时,其模仿保真度如何?

主要发现

  • 相同的神经网络架构和超参数成功学习并复制了多种动作类型,包括行走和踢球,且无需架构调整。
  • 该框架实现了对UT Austin Villa团队DRL优化踢球动作的高保真度模仿,展示了在不逆向工程控制逻辑的前提下,跨团队迁移的能力。
  • 学习到的行走动作在Forward Walk测试中实现了平均速度0.23 m/s,Y方向平均误差为0.96 m,表明开环执行下性能有效但存在偏差。
  • 尽管采用开环执行且关节动力学被削弱,学习到的动作仍保持了足够的稳定性和性能,适用于非竞争性场景。
  • 神经网络对运动的表示形式可直接将关键帧动作替换为学习到的等效动作,且在所有测试动作中均保持了性能。
  • 结果表明,学习到的神经运动可作为未来基于强化学习的策略优化的有效种子,从而支持闭环、自纠正的运动策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。