[论文解读] Self-Supervised Goal-Conditioned Pick and Place
该论文提出了一种自监督框架,通过未标注的抓取与放置交互学习像素级的物体嵌入,从而在无需人工标注数据的情况下实现目标条件的抓取与放置。通过在腕部摄像头、抓取区域和放置区域图像上应用对比学习,模型能够预测最优的抓取与放置位置,且在未见过的物体和纹理上具有良好的泛化能力,在未见纹理类别上的准确率达到70%。
Robots have the capability to collect large amounts of data autonomously by interacting with objects in the world. However, it is often not obvious \emph{how} to learning from autonomously collected data without human-labeled supervision. In this work we learn pixel-wise object representations from unsupervised pick and place data that generalize to new objects. We introduce a novel framework for using these representations in order to predict where to pick and where to place in order to match a goal image. Finally, we demonstrate the utility of our approach in a simulated grasping environment.
研究动机与目标
- 开发一种自监督方法,从未标注的机器人交互数据中学习视觉物体表征。
- 在无需人工标注的分割或CAD模型的情况下,实现目标条件的抓取与放置。
- 仅通过机器人交互的像素级监督,学习一个统一的嵌入空间,以同时支持抓取和放置预测。
- 评估在训练过程中未见过的新物体和纹理上的泛化能力。
- 证明可利用真实世界机器人数据进行视觉表征学习,而无需特权监督。
提出的方法
- 该模型使用两个全卷积的ResNet-35编码器:一个用于区域图像(抓取和放置区域),另一个用于夹持物体的腕部摄像头图像。
- 对比学习被应用于使抓取点、放置点和末端执行器像素的嵌入相似,同时使其他像素的嵌入相距更远。
- 负样本采样通过全图负样本或伽马分布采样实现,以避免相邻像素坍塌。
- 模型通过联合对比损失进行训练,该损失包含腕部摄像头到区域图像以及区域图像到区域图像的对比(抓取:放置)。
- 通过最大化腕部摄像头嵌入与每个像素处区域图像嵌入之间的点积来预测抓取和放置位置。
- 该框架使用具有随机光照和来自可描述纹理数据集的纹理物体的模拟机器人环境。
实验结果
研究问题
- RQ1能否从未标注的机器人交互中自监督地学习像素级的物体嵌入?
- RQ2此类嵌入能否泛化到训练过程中未见过的新物体和纹理?
- RQ3在抓取、放置和腕部摄像头图像上应用对比学习是否能实现准确的目标条件抓取与放置?
- RQ4负样本采样策略如何影响所学嵌入的质量?
- RQ5单一统一的嵌入空间是否能在目标条件设置下同时支持抓取和放置预测?
主要发现
- 该模型在未见纹理类别上的抓取与放置准确率达到70%,展示了强大的零样本泛化能力。
- 在50种而非10种纹理上进行训练,可提升所有验证集上的性能,包括已见纹理的性能。
- 伽马分布负采样与抓取:放置对比损失的结合取得了最佳性能,优于基线方法。
- 性能从训练集的83%下降到同纹理验证集的69%,但在未见纹理上的性能保持在约70%的稳定水平。
- 所学的相似性度量对物体内部的空间位置高度敏感,从而能够准确选择抓取与放置点。
- 该框架无需额外数据采集或特权信息,即可泛化到新物体和新纹理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。