Skip to main content
QUICK REVIEW

[论文解读] Human Instruction-Following with Deep Reinforcement Learning via Transfer-Learning from Text

Felix Hill, Soňa Mokrá|arXiv (Cornell University)|May 19, 2020
Multimodal Machine Learning Applications参考文献 43被引用 32
一句话总结

该论文介绍 SHIFTT,一种使用预训练文本编码器(例如 BERT)来引导深度 RL 代理的方法,使其能够在 3D 物体操作任务中实现从模板化指令到自然人类指令的零-shot 转移。

ABSTRACT

Recent work has described neural-network-based agents that are trained with reinforcement learning (RL) to execute language-like commands in simulated worlds, as a step towards an intelligent agent or robot that can be instructed by human users. However, the optimisation of multi-goal motor policies via deep RL from scratch requires many episodes of experience. Consequently, instruction-following with deep RL typically involves language generated from templates (by an environment simulator), which does not reflect the varied or ambiguous expressions of real users. Here, we propose a conceptually simple method for training instruction-following agents with deep RL that are robust to natural human instructions. By applying our method with a state-of-the-art pre-trained text-based language model (BERT), on tasks requiring agents to identify and position everyday objects relative to other objects in a naturalistic 3D simulated room, we demonstrate substantially-above-chance zero-shot transfer from synthetic template commands to natural instructions given by humans. Our approach is a general recipe for training any deep RL-based system to interface with human users, and bridges the gap between two research directions of notable recent success: agent-centric motor behavior and text-based representation learning.

研究动机与目标

  • 通过减少对模板生成语言的依赖来推动对指令的鲁棒遵循。
  • 提出一个简单的从文本编码器到 RL 策略的迁移学习方法。
  • 在包含 ShapeNet 对象的 3D 房间中展示对自然人类指令的零-shot 泛化。
  • 分析不同语言编码器和训练增强对泛化性与鲁棒性的影响。

提出的方法

  • 使用具备视觉处理、语言嵌入、记忆和动作/价值头的标准 RL 架构。
  • 在多种编码方案中整合预训练语言编码器(BERT)(均值池化、自注意力、跨模态注意力)。
  • 冻结 BERT 权重以避免过拟合,且可选增加一个学得的自注意力层或跨模态自注意力以融合视觉与语言。
  • 在仿真中用合成模板指令训练代理,使用 SHIFTT 步骤将语义知识分配到策略参数。
  • 在自然人类指令及通过众包收集的同义词上评估零-shot 性能,无需在人工数据上重新训练。
  • 研究 typo 噪声和分词(WordPiece)对对人类指令鲁棒性的影响。

实验结果

研究问题

  • RQ1预训练语言编码器能否实现从模板指令到自然人类指令在 RL 代理中的零-shot 转移?
  • RQ2哪些语言编码器架构(均值池化的 BERT、自注意力、跨模态注意力)最有利于在视觉与动作中的语言定界?
  • RQ3错字噪声和 WordPiece 分词如何影响对人类指令的鲁棒性?
  • RQ4在仅用合成语言的仿真训练下,代理在自然、多样化的人类指令上能达到何种程度的表现?
  • RQ5SHIFTT 方法能拓展到需要对象识别与对象放置关系的现实环境任务吗?

主要发现

  • 与非预训练基线相比,预训练文本编码器在参考任务和放置任务上均显著提高了准确性。
  • 基于 BERT 的编码器采用均值池化在相应测试中分别实现高达 77%(同义词评估)和 94%(参考风格评估)的准确性。
  • 上下文表征(BERT)在对自然指令的泛化中优于上下文无关的嵌入和单独的 WordPiece。
  • 跨模态自注意力加上错字噪声在对自然人类指令的鲁棒性方面表现出很强的韧性,特别是对自然放置指令(例如在自然指令测试中达到 70% 的准确性)。
  • WordPiece 分词与调优的自注意力层在结合错字噪声时提供鲁棒性,尽管通过冻结 BERT 权重减轻了过拟合风险。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。