Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Few-Shot Imitation with Skill Transition Models

Kourosh Hakhamaneshi, Ruihan Zhao|arXiv (Cornell University)|Jul 19, 2021
Reinforcement Learning in Robotics被引用 6
一句话总结

FIST 提出了一种分层少样本模仿学习框架,利用技能转移模型实现对未见长时序任务的泛化。通过学习一个基于当前状态和未来状态的逆向技能动态模型,并使用对比距离函数进行半参数化状态选择,FIST 防止了策略漂移,并在极少示范下实现了未见导航与机器人操作任务中的最先进性能。

ABSTRACT

A desirable property of autonomous agents is the ability to both solve long-horizon problems and generalize to unseen tasks. Recent advances in data-driven skill learning have shown that extracting behavioral priors from offline data can enable agents to solve challenging long-horizon tasks with reinforcement learning. However, generalization to tasks unseen during behavioral prior training remains an outstanding challenge. To this end, we present Few-shot Imitation with Skill Transition Models (FIST), an algorithm that extracts skills from offline data and utilizes them to generalize to unseen tasks given a few downstream demonstrations. FIST learns an inverse skill dynamics model, a distance function, and utilizes a semi-parametric approach for imitation. We show that FIST is capable of generalizing to new tasks and substantially outperforms prior baselines in navigation experiments requiring traversing unseen parts of a large maze and 7-DoF robotic arm experiments requiring manipulating previously unseen objects in a kitchen.

研究动机与目标

  • 使自主智能体能够泛化至需要复杂子任务序列的未见长时序任务。
  • 解决在仅有少量示范时,少样本模仿学习中策略漂移的挑战。
  • 通过学习单峰、未来条件化的技能策略,将数据驱动的行为先验与少样本模仿学习相结合。
  • 通过逆向技能动态模型,基于当前和未来状态联合条件化技能选择,提升泛化能力。
  • 通过在多样化离线数据上预训练并结合少量下游示范进行微调,实现对分布外(OOD)任务的有效适应。

提出的方法

  • FIST 学习一个逆向技能动态模型,用于预测从当前状态过渡到目标未来状态所需的技能,从而实现单峰且目标条件化的技能选择。
  • 引入一种对比距离函数,以在推理过程中识别最相关的示范状态,用于条件化逆向技能模型。
  • 该方法采用半参数化方法,基于与当前观测最接近的状态,从一组示范中选择最匹配的技能。
  • 技能先验在大规模多样化示范离线数据集上预训练,为下游适应提供强大的行为先验。
  • 在少量下游示范上进行微调,使模型能够适应预训练期间未见过的分布外任务。
  • 该框架结合了行为先验的结构化探索与少样本模仿学习的样本效率,实现了鲁棒的泛化性能。

实验结果

研究问题

  • RQ1我们能否学习一种技能表征,使模型在预训练期间未见过的长时序任务上实现少样本模仿学习?
  • RQ2当仅有少量示范时,如何在少样本模仿学习中防止策略漂移?
  • RQ3在多模态技能空间中,将技能策略同时基于当前和未来状态进行条件化,是否能提升泛化能力并减少模式崩溃?
  • RQ4在多样化离线数据集上预训练与直接在下游数据上微调,对分布外任务泛化能力的影响有何差异?
  • RQ5不同距离度量(如对比度量与欧氏距离)对 FIST 中半参数化状态选择性能有何影响?

主要发现

  • 在未见的长时序导航任务中,FIST 取得了最先进性能,最复杂场景下的平均成功率达到 4.0 ± 0.0,显著优于基线模型。
  • 在 7-DoF 机器人操作任务中,FIST 在涉及水壶和滑动柜等物体的未见任务中,成功率达到 3.5 ± 0.3,优于 SPiRL 及其他基线模型。
  • 消融实验表明,下游示范的微调至关重要:FIST-no-FT 的平均成功率仅为 2.0 ± 0.0,表明缺乏微调时泛化能力完全失效。
  • 在多样化离线数据集上进行预训练对泛化至关重要;FIST-no-pretrain 的平均成功率仅为 0.5 ± 0.16,凸显行为先验的重要性。
  • 对比距离函数优于欧氏距离,FIST (Euc.) 在 4 项任务中有 3 项表现略差,表明对比度量在复杂状态空间中更具鲁棒性。
  • FIST 有效泛化至分布外任务,如操作水壶或打开底柜,这些任务未包含在技能预训练数据集中,展示了强大的零样本迁移能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。