Skip to main content
QUICK REVIEW

[论文解读] Learning Robot Skills with Temporal Variational Inference

Tanmay Shankar, Abhinav Gupta|arXiv (Cornell University)|Jun 29, 2020
Machine Learning and Algorithms被引用 13
一句话总结

该论文提出了一种时间变分推理框架,能够从未经分割的机器人示范数据中无监督地联合学习低层次控制策略和高层次选项。通过将选项建模为连续潜在变量,并使用轨迹似然的时序分解,该方法发现了语义上合理且可重用的技能,从而实现高效的层次化控制,并在仿真环境中的下游操作任务中优于基线方法。

ABSTRACT

In this paper, we address the discovery of robotic options from demonstrations in an unsupervised manner. Specifically, we present a framework to jointly learn low-level control policies and higher-level policies of how to use them from demonstrations of a robot performing various tasks. By representing options as continuous latent variables, we frame the problem of learning these options as latent variable inference. We then present a temporal formulation of variational inference based on a temporal factorization of trajectory likelihoods,that allows us to infer options in an unsupervised manner. We demonstrate the ability of our framework to learn such options across three robotic demonstration datasets.

研究动机与目标

  • 为了从未经分割的示范数据中无监督地发现可重用的机器人选项,避免人工标注或固定分割。
  • 为了在统一的端到端框架中联合学习低层次控制策略和高层次选项选择策略,以实现层次化任务执行。
  • 为了解决在不依赖专家提供的选项边界或离散选项集的情况下学习有意义且可组合的技能的挑战。
  • 通过从多样化示范中学习结构化且可解释的技能空间,提升样本效率和下游任务性能。

提出的方法

  • 该框架将选项建模为连续潜在变量,将技能发现问题转化为对示范轨迹的潜在变量推断。
  • 提出了一种基于轨迹似然在时间上分解的时间变分推理(TVI)目标,支持低层次和高层次策略的联合优化。
  • 通过变分推理优化TVI目标,同时获得低层次策略(用于动作执行)和高层次策略(用于选项选择)。
  • 该方法使用序列模型(基于LSTM)表示策略,并学习一个解耦的、连续的技能空间,该空间与人类标注的原始动作一致。
  • 该框架在未经分割的原始示范轨迹上端到端训练,实现无监督的技能发现。
  • 预训练完成后,通过强化学习对学习到的策略进行微调,以评估下游任务性能。

实验结果

研究问题

  • RQ1我们能否在不依赖人工标注的选项边界的情况下,从未分割的示范数据中发现语义上合理且可重用的机器人技能?
  • RQ2如何在统一的端到端框架中联合学习低层次控制策略和高层次选项选择策略?
  • RQ3与离散或固定表示方法相比,连续潜在变量表示的选项是否能实现更好的泛化能力和下游任务性能?
  • RQ4时间变分推理能否有效建模长时序轨迹,并从多样化的机器人示范中推断出一致的技能结构?

主要发现

  • 所提方法成功发现了连续且语义上合理的选项,其与传统操作技能(如抓取、抓握、倾倒)相对应,经由轨迹回放的可视化检查得到验证。
  • 模型准确重建了示范中技能的序列,预测的技能形状在MIME和Roboturk数据集中与真实轨迹高度吻合。
  • 该框架能够捕捉细微动作,如夹爪的开合,展现出对数据中细微运动模式的高度敏感性。
  • 在Mocap数据集中,模型在不同形态的智能体上泛化良好,生成的轨迹与原始示范的趋势高度一致。
  • 在六个Robosuite仿真任务中,该方法显著优于平坦式强化学习、平坦式模仿学习和层次化强化学习基线,所有环境中平均奖励均更高。
  • 通过强化学习对预训练策略进行微调后,下游性能表现强劲,表明所学的技能空间能有效引导探索并加速学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。