[论文解读] Watch, Try, Learn: Meta-Learning from Demonstrations and Reward
本文提出 Watch, Try, Learn (WTL),一种元学习框架,使智能体仅通过一次示范和一次带有二元成功/失败反馈的尝试,即可快速掌握基于视觉的操纵技能。通过结合元模仿学习与基于试错的强化学习,WTL 在少样本学习中显著优于先前方法,在仅使用一次示范和一次尝试的情况下,实现 42% 的未见任务成功率,相较元模仿学习的 30%,以及需大量微调的模仿行为方法的 11%-39% 显著提升。
Imitation learning allows agents to learn complex behaviors from demonstrations. However, learning a complex vision-based task may require an impractical number of demonstrations. Meta-imitation learning is a promising approach towards enabling agents to learn a new task from one or a few demonstrations by leveraging experience from learning similar tasks. In the presence of task ambiguity or unobserved dynamics, demonstrations alone may not provide enough information; an agent must also try the task to successfully infer a policy. In this work, we propose a method that can learn to learn from both demonstrations and trial-and-error experience with sparse reward feedback. In comparison to meta-imitation, this approach enables the agent to effectively and efficiently improve itself autonomously beyond the demonstration data. In comparison to meta-reinforcement learning, we can scale to substantially broader distributions of tasks, as the demonstration reduces the burden of exploration. Our experiments show that our method significantly outperforms prior approaches on a set of challenging, vision-based control tasks.
研究动机与目标
- 为解决仅靠示范不足以应对视觉策略少样本学习中任务执行模糊性的问题。
- 通过利用来自试错经验的稀疏奖励反馈,使智能体在示范基础上实现超越,从而提升性能。
- 结合元模仿学习与元强化学习,实现更广泛任务分布的扩展,同时保持样本效率。
- 开发统一的元学习框架,利用示范与尝试经验,在全新未见环境中推断并优化策略。
- 使非专家用户可通过示范与反馈教学智能体新任务,降低对大规模专家数据的依赖。
提出的方法
- 该方法采用元学习器,在多样化任务上进行训练,通过两阶段内循环实现对新任务的快速适应:首先观察一次示范,随后在获得二元奖励反馈的情况下尝试任务。
- 示范编码器从单次示范中提取任务级信息,而尝试策略则基于编码后的示范与当前观测生成动作。
- 尝试策略采用后验采样策略进行训练,以探索多样化行为,同时受示范引导以降低探索成本。
- 元学习器通过优化共享策略初始化与适应机制,实现仅使用一次示范和一次尝试episode即可快速适应新任务。
- 框架采用基于视觉的观测空间,将图像观测裁剪并缩放为 100×100 输入策略网络。
- 通过利用示范塑造探索空间,并利用稀疏奖励通过试错过程优化策略,实现模仿学习与强化学习的融合。
实验结果
研究问题
- RQ1智能体能否仅通过一次示范和一次带有二元奖励反馈的尝试,学习新的基于视觉的控制任务?
- RQ2结合示范与尝试反馈,相较于纯模仿或纯强化学习,如何提升少样本泛化能力?
- RQ3元学习能否使单一模型在多样化操纵任务(包括新物体与任务变体)中实现泛化?
- RQ4示范与尝试经验的整合是否能带来比微调后的行为克隆更快、更高效的策略学习?
- RQ5在成功率与样本效率方面,所提方法相较于元模仿学习与元强化学习有何表现?
主要发现
- Watch-Try-Learn (WTL) 方法在仅使用一次示范和一次尝试的情况下,于未见元测试任务上实现了 42% 的成功率,显著优于元模仿学习 (MIL) 基线的 30%。
- WTL 超越了使用 SAC 微调的模仿行为方法,后者需 2,500 次尝试episode才达到 39% 的成功率,而 WTL 仅用一次尝试即实现 42% 的成功率。
- 在基于视觉的任务中,WTL 在四类不同任务家族(按钮按压、抓取、推动、拾取与放置)中均保持了强劲性能,展现出广泛的泛化能力。
- 该方法仅通过一次示范和一次尝试episode即实现 42% 的成功率,表明其有效解决了单次示范中固有的模糊性问题。
- 消融实验证实,示范与尝试反馈均不可或缺,移除任一组件均导致性能显著下降。
- 该框架成功从原始像素观测中学习策略,无需状态空间监督,证明了在基于视觉控制中端到端元学习的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。