Skip to main content
QUICK REVIEW

[论文解读] Deep Kernels for Optimizing Locomotion Controllers

Rika Antonova, Akshara Rai|arXiv (Cornell University)|Jul 27, 2017
Robotic Locomotion and Control参考文献 18被引用 5
一句话总结

该论文提出了一种基于高保真仿真数据训练的深度神经网络,用于在运动控制策略调优中学习有信息量的距离度量,以提升贝叶斯优化(BO)的样本效率。通过从轨迹摘要或代价函数中学习捕捉行为相似性的核函数,该方法在仿真环境中的5D ATRIAS机器人和16D神经肌肉模型上均显著提升了样本效率——相比标准核函数,所需试验次数减少超过50%。

ABSTRACT

Sample efficiency is important when optimizing parameters of locomotion controllers, since hardware experiments are time consuming and expensive. Bayesian Optimization, a sample-efficient optimization framework, has recently been widely applied to address this problem, but further improvements in sample efficiency are needed for practical applicability to real-world robots and high-dimensional controllers. To address this, prior work has proposed using domain expertise for constructing custom distance metrics for locomotion. In this work we show how to learn such a distance metric automatically. We use a neural network to learn an informed distance metric from data obtained in high-fidelity simulations. We conduct experiments on two different controllers and robot architectures. First, we demonstrate improvement in sample efficiency when optimizing a 5-dimensional controller on the ATRIAS robot hardware. We then conduct simulation experiments to optimize a 16-dimensional controller for a 7-link robot model and obtain significant improvements even when optimizing in perturbed environments. This demonstrates that our approach is able to enhance sample efficiency for two different controllers, hence is a fitting candidate for further experiments on hardware in the future.

研究动机与目标

  • 解决在真实硬件上优化高维运动控制策略时样本效率低下的挑战,其中每次试验成本高且耗时长。
  • 通过从仿真数据中自动学习有信息量的核结构,克服贝叶斯优化中对专家定义的距离度量的依赖。
  • 在复杂双足运动任务中,提升对平滑与非平滑代价函数的优化性能。
  • 通过利用仿真数据而无需手动特征工程,实现对真实机器人上先进控制器的实用化、可扩展优化。

提出的方法

  • 训练一个深度神经网络,将控制器参数映射到低维嵌入空间,以捕捉行为相似性,使用高保真仿真中的轨迹摘要作为输入。
  • 通过训练神经网络从控制器参数预测代价函数值(如行走距离、速度、能量消耗系数)来构建基于代价的核函数。
  • 通过训练神经网络重建机器人轨迹的紧凑8维摘要,构建与代价无关的核函数,实现基于相似性的核学习。
  • 将学习到的嵌入作为高斯过程核在贝叶斯优化中的输入,替代标准的RBF或Matérn核函数。
  • 在硬件(ATRIAS)和仿真(神经肌肉模型)中评估所学习核函数的性能,与标准RBF核及领域特定的DoG核进行比较。
  • 对仿真模型施加扰动(如质量/惯性扰动、粗糙地形),以测试核函数在分布偏移下的鲁棒性。

实验结果

研究问题

  • RQ1深度神经网络能否在不依赖领域专业知识的情况下,为运动控制中的贝叶斯优化学习到有效且任务相关的距离度量?
  • RQ2与标准RBF核和专家设计的DoG核相比,从仿真中学习的核函数在优化真实世界运动控制策略时的样本效率如何?
  • RQ3基于轨迹摘要重建的与代价无关的核函数,在具有挑战性的优化场景中是否能提供相当或更优的性能?
  • RQ4在环境扰动下(如质量/惯性扰动、粗糙地形),该方法在高维控制器(如16D)优化中是否仍能保持高样本效率?

主要发现

  • 在ATRIAS机器人上,基于代价的深度核函数将实现90%成功率(行走不摔倒)所需的试验次数从使用RBF核时的90多次减少至仅25次。
  • 对于具有平滑代价函数的16维神经肌肉控制器,基于轨迹嵌入的核函数(trajNN)在25次试验后达到超过90%的成功率,性能与手动设计的DoG核相当。
  • 在非平滑代价函数(惩罚摔倒并鼓励目标速度)下,trajNN核函数在100次试验内达到70%的成功率,而RBF核在相同条件下仅在50次试验中成功1次(即2%成功率)。
  • 与代价无关的trajNN核函数在平滑与非平滑代价场景中均显著优于RBF核,证明其在不同优化目标下的鲁棒性与泛化能力。
  • 即使在仿真到现实的分布偏移(如质量/惯性扰动、粗糙地形)下,该方法仍实现了显著的样本效率提升,表明其具有强大的迁移能力。
  • 结果表明,从仿真数据端到端学习核函数可达到或超越专家设计核函数的性能,显著降低对人工工程的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。