[论文解读] Object Detection using Domain Randomization and Generative Adversarial Refinement of Synthetic Images
本文提出一种混合方法,结合领域随机化与基于GAN的图像优化,仅使用合成数据和数百张真实图像,训练出一种接近实时的工业电气零件目标检测器。在合成图像生成过程中应用领域随机化,并利用Cyclic-GAN将合成图像优化为更贴近真实世界分布的图像,当结合随机化合成图像与GAN优化后的图像时,该方法在真实测试数据上的mAP超过0.95。
In this work, we present an application of domain randomization and generative adversarial networks (GAN) to train a near real-time object detector for industrial electric parts, entirely in a simulated environment. Large scale availability of labelled real world data is typically rare and difficult to obtain in many industrial settings. As such here, only a few hundred of unlabelled real images are used to train a Cyclic-GAN network, in combination with various degree of domain randomization procedures. We demonstrate that this enables robust translation of synthetic images to the real world domain. We show that a combination of the original synthetic (simulation) and GAN translated images, when used for training a Mask-RCNN object detection network achieves greater than 0.95 mean average precision in detecting and classifying a collection of industrial electric parts. We evaluate the performance across different combinations of training data.
研究动机与目标
- 解决工业目标检测中真实世界标注数据有限的挑战。
- 减少基于仿真训练中合成图像与真实世界图像之间的现实差距。
- 评估结合领域随机化与基于GAN的图像优化在提升检测器泛化能力方面的有效性。
- 仅使用数百张真实图像和大量合成数据,实现高mAP性能。
- 证明经GAN优化与领域随机化增强的合成数据,可优于仅使用合成数据或仅使用真实数据训练的模型。
提出的方法
- 使用物理模拟器(Bullet)和光线追踪器(POV-Ray)生成合成图像,渲染参数(包括光照、物体颜色、纹理和相机位置)随机化。
- 通过在指定三维空间内随机化物体颜色、纹理、场景地板和相机位置,应用领域随机化以增加训练分布的多样性。
- 在10,000张合成图像和256张真实图像上训练Cyclic-GAN,将合成图像转换为更逼真的域,训练使用256×256的随机裁剪。
- 通过引入两个并行分支的判别器——一个感受野较小以保留细节,一个感受野较大以捕捉全局上下文——来增强判别器,从而在图像转换过程中保持物体颜色。
- 最终模型结合原始合成数据与GAN优化后的图像进行训练,采用一致的超参数训练Mask-RCNN检测器。
- 通过100张真实测试图像和在0.5 IoU阈值下的mAP,评估多种训练数据组合的性能。
实验结果
研究问题
- RQ1仅使用领域随机化是否能有效减少工业目标检测中合成数据的现实差距?
- RQ2仅使用基于GAN的图像转换是否能显著提升从合成数据到真实世界数据的泛化能力?
- RQ3结合领域随机化与GAN优化是否能获得优于单一方法的检测性能?
- RQ4合成数据、随机化数据与GAN优化数据的最佳组合比例为何,可使真实世界目标检测的mAP最大化?
- RQ5在主要基于合成数据训练的检测器中,引入数百张真实图像如何影响其性能?
主要发现
- 仅使用固定颜色和纹理的合成数据训练,mAP仅为0.812,表明其在真实世界条件下泛化能力差。
- 仅使用GAN优化后的合成图像(S_fix→real)时,mAP达到0.874,性能有所提升但仍有限。
- 20% S_fix→real与80% S_rand+tex的组合实现了0.955 mAP,为所有测试配置中的最高性能。
- S_fix→real与S_rand+tex各占50%的混合配置达到0.950 mAP,证实结合优化与随机化合成数据的有效性。
- 引入具有不同感受野的双分支判别器架构,显著改善了GAN图像转换过程中的颜色保留,解决了初始的失败模式。
- 该方法仅使用256张真实图像和10,000张合成图像,就在真实世界测试数据上实现了超过0.95的mAP,展示了强大的零样本泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。