Skip to main content
QUICK REVIEW

[论文解读] IGLU Gridworld: Simple and Fast Environment for Embodied Dialog Agents

Artem Zholus, Alexey Skrynnik|arXiv (Cornell University)|May 31, 2022
Multimodal Machine Learning Applications被引用 4
一句话总结

IGLU Gridworld 是一个快速、轻量级的基于 Python 的强化学习环境,用于在带有协作对话的 3D 积木搭建任务中训练和评估语言条件的具身智能体。它通过一个多任务层次基线,实现了在多种任务类型上优于随机智能体和先前竞赛解决方案的性能,支持层次强化学习、技能学习和泛化研究。

ABSTRACT

We present the IGLU Gridworld: a reinforcement learning environment for building and evaluating language conditioned embodied agents in a scalable way. The environment features visual agent embodiment, interactive learning through collaboration, language conditioned RL, and combinatorically hard task (3d blocks building) space.

研究动机与目标

  • 开发一个可扩展、快速且透明的环境,用于训练和评估遵循自然语言指令的具身智能体。
  • 支持协作学习、模仿与强化学习中的泛化以及具身人工智能中层次决策的研究。
  • 通过一个可形式化的基于 3D 网格的任务空间,实现开放式的终身学习,该空间具有组合丰富的结构。
  • 提供一个基准环境,支持基于技能的任务分解和课程学习。
  • 通过统一且可扩展的 Python API,促进数据收集和模型评估。

提出的方法

  • 该环境使用纯 Python 实现,采用解耦的渲染器,支持无头运行和高速模拟(当禁用渲染时,最高可达 17,000 SPS)。
  • 观测包含 64×64×3 的第一人称视角图像、智能体背包、11×9×11 的 3D 建造区域网格以及智能体位姿(位置、俯仰角、偏航角)。
  • 动作空间由 14 个离散动作组成:移动、跳跃、放置/破坏积木、积木类型选择(1–6),以及连续的摄像头控制。
  • 奖励通过一种类似卷积的对齐过程计算,将当前状态网格与目标网格进行对齐,以随时间最大化每块积木的交并。
  • 任务被结构化为协作段的序列,每个段由一对(对话上下文、目标指令、目标积木配置)定义。
  • 提出了一种多任务层次强化学习基线(MHB),包含基于 BERT 的 NLP 模块用于目标预测、启发式子任务生成器,以及基于 APPO 的 RL 模块用于子任务执行。

实验结果

研究问题

  • RQ1一个轻量级、快速且可扩展的环境在复杂 3D 任务中如何支持语言条件具身智能体的训练?
  • RQ2结合课程学习的层次强化学习在多样化 3D 积木搭建任务中,能在多大程度上提升泛化能力?
  • RQ3具有 NLP、启发式规划和 RL 组件的模块化 MHB 架构,是否能在多技能环境中优于随机和基线智能体?
  • RQ4该环境如何支持具身人工智能中的基于技能的泛化和终身学习?
  • RQ5多任务层次智能体在不同任务类型(包括飞行、高耸、对角线、平面和复杂结构)上的表现如何?

主要发现

  • IGLU Gridworld 在无头模式下最高可达到每秒 17,000 步,是目前最快的基于 Python 的 3D 具身任务强化学习环境之一。
  • 多任务层次基线(MHB)在所有任务上的 F1 得分为 0.313,显著优于随机智能体(0.039),并在复杂结构上表现出色。
  • 配备 NLP 头的 MHB 智能体在所有任务上的 F1 得分为 0.313,表明其在多样化技能类型上具有强大的泛化能力。
  • 包含完整流程(包括启发式子任务生成器)的 MHB 智能体在所有任务上的 F1 得分为 0.258,证明了结构化子任务规划的价值。
  • 该环境通过组合复杂的 3D 积木配置和基于对话的协作,支持丰富的任务泛化。
  • MHB 基线优于 IGLU 2021 NeurIPS 竞赛中提交的所有解决方案,验证了其有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。