Skip to main content
QUICK REVIEW

[论文解读] Ask Your Humans: Using Human Instructions to Improve Generalization in Reinforcement Learning

Valerie Chen, Abhinav Gupta|arXiv (Cornell University)|Nov 1, 2020
Reinforcement Learning in Robotics参考文献 42被引用 6
一句话总结

本文提出了一种强化学习框架,利用人类示范中的自然语言指令,提升多任务环境中的零样本泛化能力。通过训练基于语言的文本生成器与策略,智能体能够分解复杂任务,以少量样本泛化到未见过的任务,并生成可解释、人类可读的动作序列,在已见和未见的制作任务中均优于基线方法。

ABSTRACT

Complex, multi-task problems have proven to be difficult to solve efficiently in a sparse-reward reinforcement learning setting. In order to be sample efficient, multi-task learning requires reuse and sharing of low-level policies. To facilitate the automatic decomposition of hierarchical tasks, we propose the use of step-by-step human demonstrations in the form of natural language instructions and action trajectories. We introduce a dataset of such demonstrations in a crafting-based grid world. Our model consists of a high-level language generator and low-level policy, conditioned on language. We find that human demonstrations help solve the most complex tasks. We also find that incorporating natural language allows the model to generalize to unseen tasks in a zero-shot setting and to learn quickly from a few demonstrations. Generalization is not only reflected in the actions of the agent, but also in the generated natural language instructions in unseen tasks. Our approach also gives our trained agent interpretable behaviors because it is able to generate a sequence of high-level descriptions of its actions.

研究动机与目标

  • 解决稀疏奖励、多任务强化学习中的样本效率与泛化挑战。
  • 仅通过少量人类示范与自然语言指令,使智能体能够泛化到未见过的任务。
  • 构建可解释的智能体,为成功与失败案例生成人类可读的动作描述。
  • 开发一个基于制作类网格世界的、包含人工标注语言指令与轨迹的数据集,用于训练与评估。
  • 证明语言条件化策略能够分解任务,并在多样化、未见的任务中复用子任务知识。

提出的方法

  • 该框架使用高层语言生成器,基于当前状态与目标生成自然语言指令。
  • 低层策略基于生成的语言进行条件化,以选择动作,实现分层任务分解。
  • 通过模仿学习进行模型训练,结合人类示范与语言标注,并融合强化学习奖励信号。
  • 训练数据包含在制作类网格世界环境中14个训练任务的6,000条游戏轨迹。
  • 智能体实时生成逐步指令,指导其动作,并用于评估任务分解与泛化能力。
  • 该方法支持在新任务上通过少量额外示范与指令进行少样本微调。

实验结果

研究问题

  • RQ1来自人类示范的自然语言指令能否提升多任务强化学习中的零样本泛化能力?
  • RQ2语言条件化策略在与训练任务共享子任务的未见任务上,泛化能力如何?
  • RQ3生成的语言在多大程度上准确反映任务分解,并有助于诊断智能体失败原因?
  • RQ4在微调新任务时,智能体能否仅通过少量示范快速学习?
  • RQ5与基于模板的语言相比,使用人工生成的、多样化且带噪声的语言是否能提升强化学习中的鲁棒性与可解释性?

主要发现

  • 在35个零样本制作任务的平均表现上,该模型优于基线方法,展现出无需额外奖励信号的强泛化能力。
  • 智能体通过复用共享子任务成功泛化到未见任务,表现为对新任务生成一致且正确的语言描述。
  • 语言生成器产生可解释的高层动作描述,使研究人员能够洞察成功与失败行为的原因。
  • 对于如黄金/砖块镐头等五步复杂任务,尽管训练数据有限,模型仍能生成相当一致且语义正确的指令。
  • 失败分析表明,语言生成错误(如将'gold'误用为'stocks')与某些物品在训练中出现频率较低有关;而策略失败即使在指令正确时也可能发生。
  • 该模型不仅在动作执行上实现泛化,还在生成语言的质量与连贯性上体现泛化能力,反映出类似现实世界食谱的层级化任务结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。