[论文解读] Interactive Grounded Language Understanding in a Collaborative Environment: IGLU 2021
IGLU 2021 引入了一个协作环境,用于训练交互式智能体,使其通过实时对话和任务执行来学习遵循具身自然语言指令。竞赛表明,混合模型与多阶段模型方法显著优于基线模型,冠军团队实现了 36.5% 的任务完成率,并在人类评估中表现出高度一致性。
Human intelligence has the remarkable ability to quickly adapt to new tasks and environments. Starting from a very young age, humans acquire new skills and learn how to solve new tasks either by imitating the behavior of others or by following provided natural language instructions. To facilitate research in this direction, we propose \emph{IGLU: Interactive Grounded Language Understanding in a Collaborative Environment}. The primary goal of the competition is to approach the problem of how to build interactive agents that learn to solve a task while provided with grounded natural language instructions in a collaborative environment. Understanding the complexity of the challenge, we split it into sub-tasks to make it feasible for participants.
研究动机与目标
- 开发能够在协作性、动态环境中通过具身自然语言指令学习解决问题的交互式智能体。
- 研究智能体如何主动寻求澄清并适应新指令,以模拟类人协作。
- 创建一个支持具身语言理解与强化学习智能体训练和评估的基准环境。
- 探索自然语言理解、视觉感知与决策制定在具身智能体中的整合方式。
- 通过自动化指标与人在回路的评估相结合,衡量智能体性能与现实世界的一致性。
提出的方法
- IGLU 环境构建为类似 Gym 的环境,智能体作为观察的一部分接收自然语言指令,并与 3D 世界交互以构建目标结构。
- 使用深度强化学习算法(包括 APE-X、Rainbow、IMPALA 和 Dreamer)对智能体进行训练,用于基线与竞赛解决方案。
- 冠军团队采用混合方法,通过从聊天数据中学习并采样颜色分布,提升了随机探索效率。
- NeuroAI 团队采用三阶段复合模型:基于微调的 Distil-RoBERTa 的文本到目标网格预测器、用于视觉表征的卷积自编码器,以及基于交叉注意力的策略头。
- 策略网络在图像嵌入(键/值)与预测的目标网格(查询)之间使用交叉注意力,随后通过 PPO 训练动作头与价值头。
- 采用课程学习策略扩充训练集,提升在多样化建筑任务中的泛化能力。
实验结果
研究问题
- RQ1如何训练智能体在协作性、交互式环境中理解并执行具身自然语言指令?
- RQ2主动澄清与反馈寻求在提升任务完成率与鲁棒性方面发挥何种作用?
- RQ3在复杂建筑任务中,结合语言、视觉与动作规划的多模态模型相较于简单基线模型表现如何?
- RQ4预训练的语言与视觉模型在多大程度上可通过微调实现对新任务的零样本或少样本适应?
- RQ5自动化指标与人类对智能体遵循自然语言指令表现的判断之间相关性如何?
主要发现
- 混合智能体团队在‘静默建造者’赛道中实现了最高的自动化任务完成率(36.5%),优于其他参赛方案。
- NeuroAI 团队获得第二名,完成率为 34.0%,展示了基于多阶段、注意力机制策略架构的强劲性能。
- 人类评估结果与自动化结果一致,冠军团队获得平均得票率 0.88,Krippendorff 一致性系数达 0.56。
- 无模型智能体(IMPALA)在 2000 万步后达到归一化平均奖励 12,而基于模型的智能体(Dreamer)仅用 200 万步即达到相似性能。
- 基于网格的基线模型(使用 APEX 和 Rainbow)仅能解决最简单的任务,如构建一个 5 块组成的 L 形结构。
- 竞赛结果表明,将语言理解、视觉感知与动作规划相结合,是实现在交互式、具身环境中稳健任务执行的关键。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。