Skip to main content
QUICK REVIEW

[论文解读] Learning Neuro-symbolic Programs for Language Guided Robot Manipulation

Namasivayam Kalithasan, Himanshu Singh|arXiv (Cornell University)|Nov 12, 2022
Multimodal Machine Learning Applications参考文献 33被引用 4
一句话总结

本文提出了一种神经符号框架,通过自然语言指令和场景图像端到端学习具身的操纵程序,利用分层解析器和动作模拟器,在无需子目标监督的情况下实现端到端训练。该模型通过在视觉和语言输入上进行符号推理,学习解耦的、以物体为中心的表征,从而在未见过的场景和更长时序的任务上实现最先进水平的泛化能力。

ABSTRACT

Given a natural language instruction and an input scene, our goal is to train a model to output a manipulation program that can be executed by the robot. Prior approaches for this task possess one of the following limitations: (i) rely on hand-coded symbols for concepts limiting generalization beyond those seen during training [1] (ii) infer action sequences from instructions but require dense sub-goal supervision [2] or (iii) lack semantics required for deeper object-centric reasoning inherent in interpreting complex instructions [3]. In contrast, our approach can handle linguistic as well as perceptual variations, end-to-end trainable and requires no intermediate supervision. The proposed model uses symbolic reasoning constructs that operate on a latent neural object-centric representation, allowing for deeper reasoning over the input scene. Central to our approach is a modular structure consisting of a hierarchical instruction parser and an action simulator to learn disentangled action representations. Our experiments on a simulated environment with a 7-DOF manipulator, consisting of instructions with varying number of steps and scenes with different number of objects, demonstrate that our model is robust to such variations and significantly outperforms baselines, particularly in the generalization settings. The code, dataset and experiment videos are available at https://nsrmp.github.io

研究动机与目标

  • 解决将复杂、多步骤的自然语言指令具身化为可执行机器人操纵程序的挑战,且无需中间监督。
  • 克服先前方法依赖手工编码符号、需要密集的子目标标注,或在空间和关系概念上缺乏深层语义推理的局限性。
  • 实现对包含更多物体和更长指令序列的新场景的鲁棒泛化,尤其在组合式零样本设置下表现优异。
  • 仅通过远距离监督,直接从初始和最终场景状态学习动作和空间概念的密集解耦表征。
  • 开发一种模块化、可端到端训练的架构,将符号推理与神经感知和动作预测相结合。

提出的方法

  • 使用预训练的目标检测器和特征编码器的视觉提取器,从输入场景图像中生成密集的、以物体为中心的表征。
  • 实现一个分层语言推理器,通过领域特定语言(DSL)对空间和动作概念进行自回归式构建符号程序,从指令中生成程序。
  • 集成一个视觉推理器,应用符号和空间推理来识别预测程序中哪些物体受到动作影响。
  • 采用动作模拟器,基于符号程序和视觉状态预测被移动物体的最终3D位置,损失通过动作和视觉模块反向传播。
  • 使用REINFORCE结合策略梯度优化训练语言推理器,以采样符号程序,实现可微策略学习。
  • 通过在预测物体位置上的边界框损失,端到端训练整个模型,仅依赖初始和最终世界状态进行监督。

实验结果

研究问题

  • RQ1神经符号模型能否在无需子目标监督的情况下,学习将复杂、多步骤的语言指令具身化为可执行的操纵程序?
  • RQ2该模型在训练时未见过的、包含更多物体的场景中,尤其是组合式零样本设置下,泛化能力如何?
  • RQ3在仅用短指令(如2步)进行训练后,该模型在更长时序指令(如7步任务)上的表现如何?
  • RQ4能否仅从初始和最终场景状态端到端学习到解耦的、密集的动作表征?
  • RQ5对以物体为中心的表征进行符号推理,是否能提升语言引导操纵任务中的鲁棒性和准确性?

主要发现

  • 所提出的模型在放置和识别准确率方面显著优于神经基线模型(如CLIPort和NMN+),尤其在包含多达10个物体的零样本泛化场景中表现突出。
  • 在包含超过5个物体的场景中,模型保持了高准确率(在某些设置中超过90%),得益于以物体为中心的表征和模块化推理,展现出强大的组合泛化能力。
  • 该模型能有效泛化到更长时序任务——在仅用2步计划进行训练后,即可在7步指令上实现高准确率,凸显其可扩展性和结构化推理能力。
  • 动作模拟器在物体重建上的结构相似性指数(SSIM)达到0.935,表明其在预测动作后物体状态方面具有高保真度。
  • 在处理复杂、关系性指令(如“把方块放到红色立方体右侧的绿色骰子后面”)时,该模型表现稳健,而基线模型因语义推理能力有限而失败。
  • 即使在5倍数据量下进行训练,CLIPort-5x仍表现不如所提出的模型,证实了神经符号与解耦架构相比纯神经方法的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。