Skip to main content
QUICK REVIEW

[论文解读] VLMbench: A Compositional Benchmark for Vision-and-Language Manipulation

Kaizhi Zheng, Xiaotong Chen|arXiv (Cornell University)|Jun 17, 2022
Multimodal Machine Learning Applications被引用 15
一句话总结

本文提出 VLMbench,一个可扩展的、组合式的视觉-语言操控基准,通过自动演示生成器(AMSolver)生成多样化、偏差最小化的语言指令和 6DoF 机器人轨迹。提出 6D-CLIPort,一种基于关键点的模型,用于将语言精准定位到 3D 动作,尽管抓取成功率很高,但在鲁棒的语言引导操控方面仍有显著提升空间。

ABSTRACT

Benefiting from language flexibility and compositionality, humans naturally intend to use language to command an embodied agent for complex tasks such as navigation and object manipulation. In this work, we aim to fill the blank of the last mile of embodied agents -- object manipulation by following human guidance, e.g., "move the red mug next to the box while keeping it upright." To this end, we introduce an Automatic Manipulation Solver (AMSolver) system and build a Vision-and-Language Manipulation benchmark (VLMbench) based on it, containing various language instructions on categorized robotic manipulation tasks. Specifically, modular rule-based task templates are created to automatically generate robot demonstrations with language instructions, consisting of diverse object shapes and appearances, action types, and motion constraints. We also develop a keypoint-based model 6D-CLIPort to deal with multi-view observations and language input and output a sequence of 6 degrees of freedom (DoF) actions. We hope the new simulator and benchmark will facilitate future research on language-guided robotic manipulation.

研究动机与目标

  • 解决机器人视觉-语言操控领域中缺乏可扩展、模块化且偏差最小化的基准问题。
  • 通过组合式语言和任务模板,实现对新物体和复杂多步任务的零样本泛化。
  • 开发一个按运动约束分类的基准,支持在语言指令下的多样化视觉推理。
  • 在真实的 3D 环境中评估视觉-语言模型将语言精准定位到 6DoF 机器人动作的鲁棒性。

提出的方法

  • AMSolver:一种自动演示生成器,通过模块化的基于规则的模板组合物体形状、外观、动作和运动约束等单位任务。
  • VLMbench:一个基于 3D 模拟的基准,包含 100 多项任务,按运动约束(如旋转、平移)分类,支持组合式语言指令。
  • 6D-CLIPort:一种基于关键点的视觉-语言模型,通过多视角观测和语言指令预测 6DoF 动作序列。
  • 将任务分解为抓取和移动步骤,评估指标包括目标条件抓取(G-G)和目标条件移动(G-M)成功率。
  • 使用真实路径点分析失败模式,并评估位置/方向不匹配对运动规划的影响。
  • 在已见和未见物体类别上进行评估,以测试抓取和操控中的零样本泛化能力。

实验结果

研究问题

  • RQ1一个结合组合式语言和模块化任务模板的基准,能否实现视觉-语言操控中对新物体的可扩展零样本泛化?
  • RQ2像 6D-CLIPort 这类视觉-语言模型,在遵循复杂且约束丰富的语言指令时,能否对未见的物体形状和外观实现良好泛化?
  • RQ3在语言引导的 6DoF 机器人操控中,主要的失败模式是什么,尤其是在位置和方向估计与真实值不匹配时?
  • RQ4部分监督代理(具有真实位置或方向)在 6DoF 姿态估计存在错位时,仍有多大概率失败?
  • RQ5通过运动约束分类任务和以物体为中心的表征,如何提升视觉推理能力并减少语言引导操控中的偏差?

主要发现

  • 6D-CLIPort 在诸如抓取、堆叠、放置、倒出和擦拭等任务中,无论在已见还是未见设置下,均实现了较高的目标条件抓取(G-G)成功率,表明其在物体定位方面具有强大的泛化能力。
  • 尽管抓取成功率很高,目标条件移动(G-M)成功率却显著偏低,表明主要失败点在于轨迹执行和运动规划阶段。
  • 仅视觉的代理在已见抽屉任务上出现过拟合,表现为在已见设置下抓取成功率高,但在未见设置下表现差,凸显了分布偏移问题。
  • 在开/关类任务中,G-M 成功率在已见和未见设置下相近,表明一旦正确抓取完成,移动策略便能良好泛化。
  • 失败案例主要源于错误的姿态估计:抓取姿态错误、抓错物体、目标姿态错误或目标物体错误。
  • 即使提供真实位置或方向,若估计姿态与真实姿态不匹配,6D-CLIPort 仍会失败,证明姿态对齐对运动规划成功至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。