[论文解读] Hierarchical Few-Shot Imitation with Skill Transition Models
FIST 提出了一种分层少样本模仿学习框架,利用技能转移模型实现对未见长时序任务的泛化。通过学习一个基于当前状态和未来状态的逆向技能动态模型,并使用对比距离函数进行半参数化状态选择,FIST 防止了策略漂移,并在极少示范下实现了未见导航与机器人操作任务中的最先进性能。
A desirable property of autonomous agents is the ability to both solve long-horizon problems and generalize to unseen tasks. Recent advances in data-driven skill learning have shown that extracting behavioral priors from offline data can enable agents to solve challenging long-horizon tasks with reinforcement learning. However, generalization to tasks unseen during behavioral prior training remains an outstanding challenge. To this end, we present Few-shot Imitation with Skill Transition Models (FIST), an algorithm that extracts skills from offline data and utilizes them to generalize to unseen tasks given a few downstream demonstrations. FIST learns an inverse skill dynamics model, a distance function, and utilizes a semi-parametric approach for imitation. We show that FIST is capable of generalizing to new tasks and substantially outperforms prior baselines in navigation experiments requiring traversing unseen parts of a large maze and 7-DoF robotic arm experiments requiring manipulating previously unseen objects in a kitchen.
研究动机与目标
- 使自主智能体能够泛化至需要复杂子任务序列的未见长时序任务。
- 解决在仅有少量示范时,少样本模仿学习中策略漂移的挑战。
- 通过学习单峰、未来条件化的技能策略,将数据驱动的行为先验与少样本模仿学习相结合。
- 通过逆向技能动态模型,基于当前和未来状态联合条件化技能选择,提升泛化能力。
- 通过在多样化离线数据上预训练并结合少量下游示范进行微调,实现对分布外(OOD)任务的有效适应。
提出的方法
- FIST 学习一个逆向技能动态模型,用于预测从当前状态过渡到目标未来状态所需的技能,从而实现单峰且目标条件化的技能选择。
- 引入一种对比距离函数,以在推理过程中识别最相关的示范状态,用于条件化逆向技能模型。
- 该方法采用半参数化方法,基于与当前观测最接近的状态,从一组示范中选择最匹配的技能。
- 技能先验在大规模多样化示范离线数据集上预训练,为下游适应提供强大的行为先验。
- 在少量下游示范上进行微调,使模型能够适应预训练期间未见过的分布外任务。
- 该框架结合了行为先验的结构化探索与少样本模仿学习的样本效率,实现了鲁棒的泛化性能。
实验结果
研究问题
- RQ1我们能否学习一种技能表征,使模型在预训练期间未见过的长时序任务上实现少样本模仿学习?
- RQ2当仅有少量示范时,如何在少样本模仿学习中防止策略漂移?
- RQ3在多模态技能空间中,将技能策略同时基于当前和未来状态进行条件化,是否能提升泛化能力并减少模式崩溃?
- RQ4在多样化离线数据集上预训练与直接在下游数据上微调,对分布外任务泛化能力的影响有何差异?
- RQ5不同距离度量(如对比度量与欧氏距离)对 FIST 中半参数化状态选择性能有何影响?
主要发现
- 在未见的长时序导航任务中,FIST 取得了最先进性能,最复杂场景下的平均成功率达到 4.0 ± 0.0,显著优于基线模型。
- 在 7-DoF 机器人操作任务中,FIST 在涉及水壶和滑动柜等物体的未见任务中,成功率达到 3.5 ± 0.3,优于 SPiRL 及其他基线模型。
- 消融实验表明,下游示范的微调至关重要:FIST-no-FT 的平均成功率仅为 2.0 ± 0.0,表明缺乏微调时泛化能力完全失效。
- 在多样化离线数据集上进行预训练对泛化至关重要;FIST-no-pretrain 的平均成功率仅为 0.5 ± 0.16,凸显行为先验的重要性。
- 对比距离函数优于欧氏距离,FIST (Euc.) 在 4 项任务中有 3 项表现略差,表明对比度量在复杂状态空间中更具鲁棒性。
- FIST 有效泛化至分布外任务,如操作水壶或打开底柜,这些任务未包含在技能预训练数据集中,展示了强大的零样本迁移能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。