Skip to main content
QUICK REVIEW

[论文解读] CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks

Oier Mees, Lukás Hermann|arXiv (Cornell University)|Dec 6, 2021
Multimodal Machine Learning Applications被引用 6
一句话总结

CALVIN 是一个用于在长时程操作任务中训练和评估语言条件化机器人策略的仿真基准,采用自然语言指令、多模态感知输入(RGB-D、本体感觉、触觉)以及7自由度连续控制。多情境模仿学习基线在包含五个指令的长时程链上仅取得0.08%的成功率,凸显了零样本泛化和感知对齐方面的重大挑战,也突显了在视觉-语言-机器人融合领域开发新方法的必要性。

ABSTRACT

General-purpose robots coexisting with humans in their environment must learn to relate human language to their perceptions and actions to be useful in a range of daily tasks. Moreover, they need to acquire a diverse repertoire of general-purpose skills that allow composing long-horizon tasks by following unconstrained language instructions. In this paper, we present CALVIN (Composing Actions from Language and Vision), an open-source simulated benchmark to learn long-horizon language-conditioned tasks. Our aim is to make it possible to develop agents that can solve many robotic manipulation tasks over a long horizon, from onboard sensors, and specified only via human language. CALVIN tasks are more complex in terms of sequence length, action space, and language than existing vision-and-language task datasets and supports flexible specification of sensor suites. We evaluate the agents in zero-shot to novel language instructions and to novel environments and objects. We show that a baseline model based on multi-context imitation learning performs poorly on CALVIN, suggesting that there is significant room for developing innovative agents that learn to relate human language to their world models with this benchmark.

研究动机与目标

  • 为多样化、真实的环境中长时程、语言条件化机器人操作缺乏标准化基准的问题提供解决方案。
  • 使智能体能够在无需微调的情况下泛化到新环境和新语言指令。
  • 支持开发能够将语言与感知和行动相融合的多模态、连续控制策略。
  • 提供一个模块化、开源的仿真框架,用于训练、原型设计和验证语言条件化策略。
  • 建立严格的评估协议,包含逐步提升难度的评估层级,包括跨环境和跨语言的零样本泛化。

提出的方法

  • 该基准基于一个包含四个室内操作场景的仿真环境构建,支持灵活的传感器配置,包括固定式和夹持器安装的RGB-D摄像头、本体感觉,以及基于视觉的触觉传感。
  • 使用约24小时的非结构化遥操作游戏数据和20,000条多样化、非约束性的语言指令用于训练。
  • 该框架支持使用模仿学习和强化学习方法进行策略的训练与评估。
  • 评估涵盖多种模式:同环境、多环境,以及零样本多环境泛化。
  • 实现了多情境模仿学习(MCIL)基线,通过重新标注的演示将可重用行为提炼为以目标为导向的策略。
  • 该基准通过在三个环境中进行训练并在一个此前未见过的环境中进行测试,实现了零样本评估,且测试时使用的语言指令在训练中未出现过。

实验结果

研究问题

  • RQ1语言条件化策略能否泛化到训练期间未见过的新环境和新语言指令?
  • RQ2在长时程操作任务中,多模态输入(视觉、本体感觉、触觉)如何影响策略性能?
  • RQ3模仿学习方法(如MCIL)在高维状态和动作空间的复杂、长时程任务中,其泛化能力能达到何种程度?
  • RQ4传感器模态选择(如夹持器摄像头、深度图、触觉)在提升感知对齐和任务成功率方面起到什么作用?
  • RQ5训练与测试环境之间的分布偏移如何影响语言条件化控制策略的泛化能力?

主要发现

  • 在同环境设置下的短时程任务中,MCIL基线达到了53.9%的成功率,表明其在简单子任务上具备一定能力。
  • 在涉及五个连续指令的长时程任务中,MCIL基线仅取得0.08%的成功率,表明其在长时程规划方面存在严重失败。
  • 策略通常能正确执行早期子任务(第一个指令的成功率为48.9%),但在后续任务中失败,表明存在错误累积现象。
  • 在零样本多环境评估中性能显著下降,表明其泛化能力远未超越训练分布。
  • 策略在感知对齐方面表现不佳,经常混淆颜色描述(如红色与蓝色积木),表明跨模态对齐存在局限性。
  • 增加夹持器摄像头或深度通道等传感器并未显著提升性能,暗示需要更优的传感器融合或表征学习方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。