Skip to main content
QUICK REVIEW

[论文解读] Reasoning Grasping via Multimodal Large Language Model

Shiyu Jin, Jinxuan Xu|arXiv (Cornell University)|Feb 9, 2024
Natural Language Processing Techniques被引用 4
一句话总结

本文提出了一种新型任务——推理抓取(reasoning grasping),即机器人利用与视觉抓取框架集成的多模态大语言模型(LLM),从隐式口头指令中生成精确的抓取姿态。该方法通过特殊标记识别和文本特征投影来增强抓取预测,实测成功率达到25/40,显著优于CLIP+GR-ConvNet基线模型(15/40的姿态准确率)。

ABSTRACT

Despite significant progress in robotic systems for operation within human-centric environments, existing models still heavily rely on explicit human commands to identify and manipulate specific objects. This limits their effectiveness in environments where understanding and acting on implicit human intentions are crucial. In this study, we introduce a novel task: reasoning grasping, where robots need to generate grasp poses based on indirect verbal instructions or intentions. To accomplish this, we propose an end-to-end reasoning grasping model that integrates a multimodal Large Language Model (LLM) with a vision-based robotic grasping framework. In addition, we present the first reasoning grasping benchmark dataset generated from the GraspNet-1 billion, incorporating implicit instructions for object-level and part-level grasping. Our results show that directly integrating CLIP or LLaVA with the grasp detection model performs poorly on the challenging reasoning grasping tasks, while our proposed model demonstrates significantly enhanced performance both in the reasoning grasping benchmark and real-world experiments.

研究动机与目标

  • 解决当前机器人抓取系统依赖显式语言指令且缺乏场景理解能力的局限性。
  • 使机器人能够理解隐式人类意图(如“我需要喝水”),并自主选择并抓取相应物体。
  • 构建一个用于推理抓取的新基准数据集,包含隐式指令、物体级和部件级抓取标注,以及1亿个抓取姿态。
  • 设计一个端到端模型,直接将视觉输入和复杂指令映射为精确抓取姿态,利用多模态LLM进行推理。
  • 证明将多模态LLM与抓取检测结合,相比直接集成CLIP或LLaVA,能显著提升在隐式指令任务上的性能。

提出的方法

  • 模型使用多模态LLM(微调后的LLaVA)解释视觉输入和隐式语言指令,生成标识抓取目标的文本输出。
  • 通过识别LLM输出中的特殊标记,仅提取最相关的目标物体名称,减少冗余并提高专注度。
  • 利用可学习的投影网络将这些关键标记的文本嵌入转换为紧凑的特征表示。
  • 将该文本特征与视觉特征在抓取检测头中融合,以指导更精确的抓取姿态预测。
  • 该框架在源自GraspNet-1Billion的新推理抓取基准数据集上进行训练和评估,包含1730条隐式指令和1亿个抓取姿态。
  • 真实世界实验使用7自由度Franka Panda机械臂和Azure Kinect进行感知,评估执行前3个预测抓取姿态的表现。

实验结果

研究问题

  • RQ1多模态LLM能否有效用于在杂乱的真实环境中理解隐式人类指令并生成精确的抓取姿态?
  • RQ2与直接集成视觉-语言模型相比,LLM生成的文本特征如何提升抓取姿态预测性能?
  • RQ3在机器人抓取任务中,显式指令与隐式指令任务之间存在多大性能差距?统一模型能否同时处理两类任务?
  • RQ4专门的标记识别策略在多大程度上能提升LLM输出中目标物体识别的相关性和准确性?
  • RQ5在训练中未见过的新物体或部件上,该模型在隐式指令条件下的泛化能力如何?

主要发现

  • 所提出的推理抓取模型在隐式指令下的真实世界物体抓取任务中取得了25/40的成功率,显著优于CLIP+GR-ConvNet基线模型(16/40成功率)。
  • 在40次隐式指令测试中,模型正确识别了目标物体名称39次,展现出强大的推理与理解能力。
  • 该模型的抓取姿态准确率为25/40,而CLIP+GR-ConvNet基线为15/40,表明抓取预测质量得到提升。
  • 在部件级抓取任务中,该模型取得了6/10的准确率,而基线仅为2/10,表明其在部件级任务中具有更好的泛化能力。
  • 微调后的LLaVA模型保持了较强的推理能力,在GPT-4裁判评估中得分为7.43/10,接近原始LLaVA-7B-v0的8.25/10。
  • 新构建的推理抓取基准数据集包含64种物体、109个部件、1730条推理指令,以及约1亿个抓取姿态,可全面评估隐式指令理解能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。