[论文解读] Can Foundation Models Perform Zero-Shot Task Specification For Robot Manipulation?
该论文提出 ZeST,一种零样本任务规范框架,利用基础模型使机器人能够在无需微调的情况下,通过自然语言、互联网图像或草图理解目标规范。通过将观测结果和目标嵌入共享空间并测量相似性,ZeST 在零样本目标选择中实现了比随机猜测高 14 倍的性能提升,并支持离线强化学习策略,其性能达到专家水平的 90.77%。
Task specification is at the core of programming autonomous robots. A low-effort modality for task specification is critical for engagement of non-expert end-users and ultimate adoption of personalized robot agents. A widely studied approach to task specification is through goals, using either compact state vectors or goal images from the same robot scene. The former is hard to interpret for non-experts and necessitates detailed state estimation and scene understanding. The latter requires the generation of desired goal image, which often requires a human to complete the task, defeating the purpose of having autonomous robots. In this work, we explore alternate and more general forms of goal specification that are expected to be easier for humans to specify and use such as images obtained from the internet, hand sketches that provide a visual description of the desired task, or simple language descriptions. As a preliminary step towards this, we investigate the capabilities of large scale pre-trained models (foundation models) for zero-shot goal specification, and find promising results in a collection of simulated robot manipulation tasks and real-world datasets.
研究动机与目标
- 使非专家用户能够通过自然语言、草图或互联网图像等直观、低努力的模态指定机器人任务。
- 探究基础模型是否能在机器人领域实现零样本任务规范,避免对专家演示或复杂奖励工程的依赖。
- 评估 ZeST 在模拟和真实世界环境中进行零样本目标与动作选择的有效性。
- 探索使用 ZeST 相似度分数作为离线强化学习中代理奖励函数的可行性。
- 通过使用预训练的视觉和语言模型,弥合模拟与真实世界机器人学习之间的领域差距。
提出的方法
- ZeST 使用预训练的基础模型(如 CLIP、ResNet 或 MoCo)将机器人观测结果和目标规范(如文本、图像、草图)嵌入共享潜在空间。
- 通过余弦相似度或对比损失计算嵌入后的观测与目标之间的相似度,形成零样本奖励信号。
- 在零样本目标选择中,该方法选择与当前观测相似度最高的目标,无需任务特定的微调。
- 在离线强化学习中,ZeST 的相似度分数被用作代理奖励函数,通过决策变压器训练策略。
- 该框架在模拟的 Franka Kitchen 环境和真实世界的 SSV2 风格操作任务中进行了评估,涵盖真实到真实(real2real)和模拟到真实(sim2real)目标规范模态。
- 比较了多种嵌入模型(CLIP、ResNet、MoCo),以评估在不同视觉和语言编码器下的鲁棒性与性能。
实验结果
研究问题
- RQ1基础模型是否能够通过自然语言或互联网图像作为目标,在机器人操作中实现零样本任务规范?
- RQ2与随机猜测相比,ZeST 在无需微调的情况下选择正确目标和动作的有效性如何?
- RQ3ZeST 的相似度分数是否可作为离线强化学习中训练策略的可行代理奖励函数?
- RQ4在真实世界和模拟到真实设置中,ZeST 的性能在不同嵌入模型(如 CLIP 与 ResNet)之间有何差异?
- RQ5在使用预训练模型的情况下,ZeST 在多大程度上能够弥合机器人学习中的模拟到真实领域差距?
主要发现
- 在多个领域和模态的零样本目标选择任务中,ZeST 相较于随机猜测实现了 14 倍的成功率提升。
- 在 SSV2 真实到真实设置中,ResNet 和 MoCo 嵌入优于 CLIP,其 top-25 成功率显著高于随机水平,表明模型对嵌入选择具有敏感性。
- 当用作离线强化学习中的奖励代理时,ZeST+DT 达到了专家性能的 90.77%,优于行为克隆(80.67%)和示范平均值(81.19%)。
- 该框架在模拟到模拟和模拟到真实设置中均表现出可行性,显示出跨领域任务规范的潜力。
- 在真实到真实设置中,CLIP 的表现仅略优于随机,表明某些基础模型在领域泛化方面存在局限性。
- 遮挡和视觉特征缺乏定位性仍是挑战,特别是在机械臂遮挡视野时,表明需要改进视觉定位能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。