[论文解读] Kinematically-Informed Interactive Perception: Robot-Generated 3D Models for Classification
本文提出运动学感知交互感知(KIIP)框架,利用机器人在主动操作过程中的运动学知识,从RGBD数据生成精确的3D体素模型,实现实时分类杂乱环境中的未知物体。通过结合机器人位姿数据与多视角观测,KIIP在家居物体上实现80%的分类准确率,在新型乐高结构上实现60%的准确率,展示了在真实机器人应用中有效实现零样本和少样本学习的能力。
To be useful in everyday environments, robots must be able to observe and learn about objects. Recent datasets enable progress for classifying data into known object categories; however, it is unclear how to collect reliable object data when operating in cluttered, partially-observable environments. In this paper, we address the problem of building complete 3D models for real-world objects using a robot platform, which can remove objects from clutter for better classification. Furthermore, we are able to learn entirely new object categories as they are encountered, enabling the robot to classify previously unidentifiable objects during future interactions. We build models of grasped objects using simultaneous manipulation and observation, and we guide the processing of visual data using a kinematic description of the robot to combine observations from different view-points and remove background noise. To test our framework, we use a mobile manipulation robot equipped with an RGBD camera to build voxelized representations of unknown objects and then classify them into new categories. We then have the robot remove objects from clutter to manipulate, observe, and classify them in real-time.
研究动机与目标
- 解决在传统被动感知失效的杂乱、部分可观测真实环境中可靠进行3D物体建模与分类的挑战。
- 使机器人能够学习并分类现有训练数据集中不存在的新物体类别,例如ModelNet40中的物体。
- 利用机器人运动学与主动操作,通过结合多视角观测与位姿信息,提升3D重建与分类性能。
- 为移动操作机器人开发一种实用且实时的框架,通过RGBD传感从密集杂乱中分离、观测并分类未知物体。
- 证明运动学感知的视觉数据融合可提升分类性能,优于被动感知或非运动学引导的方法。
提出的方法
- 使用配备RGBD相机的移动操作机器人(HSR)对抓取物体进行同步操作与观测。
- 利用关节编码器提供的运动学信息,将多个2.5D点云观测对齐并融合为单一3D体素网格表示。
- 通过在物体旋转和重新定位过程中,从多个视角累积占据网格,构建基于KIIP的3D模型。
- 在KIIP生成的3D模型上训练浅层3D卷积神经网络(CNN),对物体进行已知类别或新学习类别的分类。
- 采用两阶段训练方法:先在ModelNet40上预训练,再在机器人收集的KIIP数据上微调,以适应新物体类别。
- 实现从杂乱中实时移除物体,随后通过KIIP进行观测与分类,以模拟非结构化环境中的交互式学习。
实验结果
研究问题
- RQ1机器人能否通过主动操作与视觉传感,在杂乱、部分可观测的环境中生成可靠的3D物体模型?
- RQ2运动学感知的多视角观测融合在提升3D重建与物体分类准确率方面有多高效?
- RQ3机器人能否利用自生成的KIIP数据,对预训练中未见过的新物体类别进行分类学习?
- RQ4与被动感知或非运动学引导的主动感知相比,KIIP分类的性能如何?
- RQ5对于乐高结构等新型非传统物体,KIIP抓取次数如何影响分类准确率?
主要发现
- KIIP框架在仅使用机器人收集的KIIP数据进行训练的网络上,对家居物体实现了80%的分类准确率,证明了自监督3D物体学习的可行性。
- 对于新型乐高结构,OL-E2E网络在所有训练配置下实现了60%的整体分类准确率,展现出更强的鲁棒性与速度。
- OL-E2E网络仅需在单张GPU上14秒的训练时间,是所有测试模型中最快且最高效的。
- FG-OL与OL-E2E网络(均在KIIP数据上训练)在新型乐高物体上的表现显著优于仅在ModelNet40上训练的FG网络,表明机器人生成数据在少样本学习中的价值。
- 该方法通过逐个移除未知物体、通过KIIP观测并分配至新学习类别,成功实现了对密集杂乱中未知物体的分类。
- 运动学信息的使用实现了2.5D点云的精确对齐与融合,无需依赖特征匹配或复杂的3D配准,简化了感知流程。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。