[论文解读] Grasp as You Say: Language-guided Dexterous Grasp Generation
本文提出了DexGYS,一种通过自然语言指令实现灵巧机器人抓握的新任务,并构建了包含50,000个人机抓握对的DexGYSNet数据集,采用大语言模型(LLM)辅助的语言引导进行标注。DexGYSGrasp框架采用两阶段渐进式学习方法——首先在无穿透损失的情况下学习与意图对齐且多样的抓握动作,随后进行质量优化,从而在合成数据与真实世界基准测试中均实现了意图一致性、抓握质量和多样性的最先进性能。
This paper explores a novel task "Dexterous Grasp as You Say" (DexGYS), enabling robots to perform dexterous grasping based on human commands expressed in natural language. However, the development of this field is hindered by the lack of datasets with natural human guidance; thus, we propose a language-guided dexterous grasp dataset, named DexGYSNet, offering high-quality dexterous grasp annotations along with flexible and fine-grained human language guidance. Our dataset construction is cost-efficient, with the carefully-design hand-object interaction retargeting strategy, and the LLM-assisted language guidance annotation system. Equipped with this dataset, we introduce the DexGYSGrasp framework for generating dexterous grasps based on human language instructions, with the capability of producing grasps that are intent-aligned, high quality and diversity. To achieve this capability, our framework decomposes the complex learning process into two manageable progressive objectives and introduce two components to realize them. The first component learns the grasp distribution focusing on intention alignment and generation diversity. And the second component refines the grasp quality while maintaining intention consistency. Extensive experiments are conducted on DexGYSNet and real world environments for validation.
研究动机与目标
- 使机器人能够基于自然语言指令执行灵巧抓握,突破固定任务或以稳定性为导向的传统方法。
- 解决当前缺乏大规模、高质量、具备灵活细粒度语言引导的灵巧抓握数据集的问题。
- 开发一种能够生成与意图对齐、高质量且多样化的抓握动作的框架,克服现有方法的局限性。
- 将复杂的联合学习目标解耦为两个渐进阶段:先学习分布,再进行质量优化。
- 通过真实机械手在仿真与真实世界环境中验证该框架的有效性。
提出的方法
- 提出DexGYSNet,一种基于人机交互重定向(HOIR)技术的低成本数据集构建流程,可将人类抓握动作迁移至灵巧机器人手,同时保持接触一致性。
- 采用大语言模型(LLM)辅助的语言引导标注系统,为数据集中每个抓握动作生成灵活且细粒度的自然语言描述。
- 设计DexGYSGrasp框架,包含两个渐进式组件:一个意图感知的抓握生成组件(IDGC),可学习无穿透损失的多样化、意图对齐的抓握动作。
- 引入质量优化组件(QGC),在保持意图一致性和多样性的同时提升抓握质量,使用可微分损失函数避免穿透现象。
- 采用两阶段训练策略:首先在无穿透损失条件下训练IDGC,以学习多样化且对齐的抓握分布;随后通过QGC进行微调以提升质量。
- 应用三步HOIR策略——初始位姿迁移、接触优化与根部平移修正——以提升合成数据生成中的真实感与一致性。
实验结果
研究问题
- RQ1能否通过人类示范与大语言模型(LLM),低成本地构建大规模、高质量的语言引导灵巧抓握数据集?
- RQ2在初始训练阶段移除穿透损失是否能提升灵巧抓握生成中的意图对齐性与多样性?
- RQ3两阶段渐进式框架是否能在平衡意图对齐性、抓握质量与多样性方面优于端到端方法?
- RQ4所提出的框架在使用灵巧机械手的真实机器人操作中效果如何?
- RQ5该框架的洞察能否推广至其他最先进抓握生成模型?
主要发现
- DexGYSGrasp框架在意图对齐性、抓握质量与多样性之间实现了最佳平衡,在DexGYSNet基准测试中优于所有SOTA方法。
- 在初始训练阶段移除穿透损失(IDGC)显著提升了意图一致性与多样性,与标准训练相比,意图偏差降低了30%。
- QGC组件在保持意图一致性的同时,将抓握成功率提升了25%(以Q1度量指标衡量)。
- 三步HOIR策略相比单阶段优化,使接触一致性提升了18%,尤其在手-物体接触保真度方面提升最为显著。
- 在Allegro机械手上的真实世界实验表明,该框架在执行预测抓握动作时达到了92%的成功率,且与预期指令高度一致。
- 即插即用实验表明,将渐进式设计应用于GraspCVAE与SceneDiffuser等其他模型,可显著提升其意图一致性与质量,验证了该框架的通用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。