Skip to main content
QUICK REVIEW

[论文解读] Learning Semantic Embedding Spaces for Slicing Vegetables

Mohit Sharma, Kevin Zhang|arXiv (Cornell University)|Mar 30, 2019
Robot Manipulation and Learning参考文献 18被引用 8
一句话总结

本文提出了一种两阶段学习框架,通过基于交互的辅助任务(特别是预测切片厚度)来学习语义丰富、以物体为中心的蔬菜切片嵌入表示。通过在这些任务上训练嵌入网络,然后利用嵌入表示学习前向模型,该方法实现在潜在空间中的精确在线规划。实验表明,该模型能够捕捉厚度等连续语义属性,并在黄瓜和番茄之间实现泛化。

ABSTRACT

In this work, we present an interaction-based approach to learn semantically rich representations for the task of slicing vegetables. Unlike previous approaches, we focus on object-centric representations and use auxiliary tasks to learn rich representations using a two-step process. First, we use simple auxiliary tasks, such as predicting the thickness of a cut slice, to learn an embedding space which captures object properties that are important for the task of slicing vegetables. In the second step, we use these learned latent embeddings to learn a forward model. Learning a forward model affords us to plan online in the latent embedding space and forces our model to improve its representations while performing the slicing task. To show the efficacy of our approach we perform experiments on two different vegetables: cucumbers and tomatoes. Our experimental evaluation shows that our method is able to capture important semantic properties for the slicing task, such as the thickness of the vegetable being cut. We further show that by using our learned forward model, we can plan for the task of vegetable slicing.

研究动机与目标

  • 开发一种表示学习方法,以捕捉机器人操作任务中相关的语义属性,特别是蔬菜切片任务。
  • 解决在不依赖手工设计特征的情况下,学习可泛化、有意义的可变形、形状多变物体表示的挑战。
  • 通过交互和辅助学习提升表示质量,而非仅依赖模仿或奖励塑形。
  • 利用在嵌入表示上训练的前向模型,实现在学习到的潜在嵌入空间中的在线规划。
  • 在涉及黄瓜和番茄的真实机器人任务中验证该方法,展示其语义理解能力和规划能力。

提出的方法

  • 使用交互数据和辅助任务(特别是预测切蔬菜片的厚度)来训练嵌入网络。
  • 采用两步流程:首先在辅助任务上预训练嵌入网络,以学习以物体为中心的表示;其次在学习到的嵌入表示上训练前向模型。
  • 利用前向模型在潜在空间中进行多步未来状态预测,实现在线规划。
  • 利用前向模型的预测结果,通过自监督方式迭代改进学习到的嵌入表示的质量。
  • 采用3D卷积神经网络架构,处理来自多个摄像头(侧面、机械臂安装、手持臂)的RGB图像,以获取状态观测。
  • 应用主成分分析(PCA)以可视化和验证学习到的嵌入空间的语义结构。

实验结果

研究问题

  • RQ1像切片厚度预测这样的辅助任务能否有效引导学习到语义上合理、以物体为中心的蔬菜切片表示?
  • RQ2所学习的嵌入空间是否以结构化且可泛化的方式捕捉到厚度等连续语义属性?
  • RQ3在学习到的嵌入表示上训练的前向模型能否实现在潜在空间中对蔬菜切片进行准确的多步规划?
  • RQ4前向模型与嵌入网络之间的交互如何通过自我改进机制提升表示质量?
  • RQ5该方法在不同形状和材料属性的蔬菜(黄瓜与番茄)之间具有多大程度的泛化能力?

主要发现

  • 所学习的嵌入空间捕捉到了厚度等语义属性,视觉上相似的类别(例如非常薄和薄)在嵌入空间中聚类得较为接近。
  • 前向模型预测的嵌入与通过嵌入网络计算出的真实嵌入高度吻合,表明其具备准确的状态转移建模能力。
  • 前向模型在相邻厚度类别(如薄与非常薄)上的预测具有更高的方差,表明其学习到了对厚度的连续理解。
  • 在潜在空间中的多步规划成功模拟了蔬菜状态在多次切割过程中的演变,嵌入表示根据切片厚度的改变而适当调整。
  • 该模型在不同蔬菜之间具有泛化能力:尽管黄瓜和番茄在形状和质地上存在差异,但模型仍能学习到一致的表示。
  • 前向模型与嵌入网络之间的迭代反馈回路提升了表示质量,模型通过规划过程学习到更好地编码与任务相关的属性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。