[论文解读] Object Detection Using Sim2Real Domain Randomization for Robotic Applications
本文提出了一种用于机器人目标检测的模拟到真实(sim2real)领域随机化方法,仅使用合成数据和一张真实图像即可实现零样本(zero-shot)和少样本(one-shot)迁移学习。通过应用广泛的领域随机化,包括随机纹理、后处理操作以及基于物理的仿真,该方法在真实工业数据集上实现了86.32%的mAP50(零样本)和97.38%的mAP50(少样本),实现了无需大量真实数据标注的实时、可靠机器人抓取与放置任务中的目标检测。
Robots working in unstructured environments must be capable of sensing and interpreting their surroundings. One of the main obstacles of deep-learning-based models in the field of robotics is the lack of domain-specific labeled data for different industrial applications. In this article, we propose a sim2real transfer learning method based on domain randomization for object detection with which labeled synthetic datasets of arbitrary size and object types can be automatically generated. Subsequently, a state-of-the-art convolutional neural network, YOLOv4, is trained to detect the different types of industrial objects. With the proposed domain randomization method, we could shrink the reality gap to a satisfactory level, achieving 86.32% and 97.38% mAP50 scores, respectively, in the case of zero-shot and one-shot transfers, on our manually annotated dataset containing 190 real images. Our solution fits for industrial use as the data generation process takes less than 0.5 s per image and the training lasts only around 12 h, on a GeForce RTX 2080 Ti GPU. Furthermore, it can reliably differentiate similar classes of objects by having access to only one real image for training. To our best knowledge, this is the only work thus far satisfying these constraints.
研究动机与目标
- 解决工业机器人中深度学习模型训练面临的真实世界领域特定、专家标注数据有限的问题。
- 在仅需极少真实数据的前提下,实现非结构化工业环境中目标检测的零样本和少样本迁移学习。
- 开发一种可扩展、自动化的合成数据集生成流水线,可生成任意规模和物体类型的数据,以减少对昂贵真实世界数据采集的依赖。
- 确保在不同光照条件和干扰物存在下,系统具备实时性能和鲁棒性,适用于机器人应用部署。
- 在真实机器人抓取与放置系统中验证该方法的有效性,实现可靠的目标定位与抓取姿态估计。
提出的方法
- 使用带有随机物体纹理、光照和背景变化的仿真框架,自动生成大规模合成数据集。
- 应用领域随机化技术,包括随机纹理应用、后处理增强(如模糊、噪声)以及随机相机参数设置,以减小模拟到真实世界的领域差距。
- 在仿真中模拟真实的物理条件,如重力作用和随机初始物体放置,以提升模型泛化能力。
- 采用全点边界框计算方法,提升在杂乱场景中的检测鲁棒性。
- 在随机化的合成数据上训练基于YOLOv4的目标检测器,并在少样本设置中仅使用一张真实图像进行微调。
- 将训练好的模型集成到基于ROS的机器人控制框架中,通过主成分分析(PCA)和相机标定实现实时推理与姿态估计。
实验结果
研究问题
- RQ1领域随机化是否足以减小模拟到真实世界的领域差距,从而仅用一张真实图像进行微调即可实现高性能的目标检测?
- RQ2所提出的领域随机化流水线在实现工业目标检测的零样本和少样本迁移学习方面效果如何?
- RQ3具体随机化组件(如纹理、后处理、物理仿真)在多大程度上促进了模型的泛化能力?
- RQ4该方法是否能在真实机器人系统中实现实时推理,并在不同光照条件和杂乱环境下保持可靠检测?
- RQ5在仅使用极少真实世界数据的条件下,该方法与现有方法相比在mAP50性能上表现如何?
主要发现
- 所提出的模拟到真实领域随机化方法在零样本迁移中实现了86.32%的mAP50,证明了仅依赖合成数据即可实现强大泛化能力。
- 仅使用一张真实图像进行微调后,模型mAP50达到97.38%,显著优于类似数据约束下的现有方法。
- 消融实验确认,后处理领域随机化和随机纹理应用是降低因领域偏移导致性能下降的关键因素。
- 引入基于物理的仿真(重力、随机放置)以及全点边界框方法,显著提升了检测的鲁棒性与准确性。
- 系统在GeForce RTX 3060 GPU上实现了20 FPS的实时推理,即使在光照变化和存在干扰物的情况下,也能实现可靠的目标检测与定位。
- 该方法成功部署于真实机器人抓取与放置系统中,实现了端到端功能,具备高置信度的预测与精确的姿态估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。