[论文解读] Training Deep Networks with Synthetic Data: Bridging the Reality Gap by Domain Randomization
本文提出领域随机化(DR)方法,仅使用合成数据训练深度神经网络进行目标检测,通过随机扰动光照、纹理和物体位姿等仿真参数来弥合现实差距。该方法在KITTI数据集上实现了最先进性能——在微调后,其性能优于使用照片级真实感合成数据训练的模型,甚至超越了仅使用真实数据训练的模型。
We present a system for training deep neural networks for object detection using synthetic images. To handle the variability in real-world data, the system relies upon the technique of domain randomization, in which the parameters of the simulator$-$such as lighting, pose, object textures, etc.$-$are randomized in non-realistic ways to force the neural network to learn the essential features of the object of interest. We explore the importance of these parameters, showing that it is possible to produce a network with compelling performance using only non-artistically-generated synthetic data. With additional fine-tuning on real data, the network yields better performance than using real data alone. This result opens up the possibility of using inexpensive synthetic data for training neural networks while avoiding the need to collect large amounts of hand-annotated real-world data or to generate high-fidelity synthetic worlds$-$both of which remain bottlenecks for many applications. The approach is evaluated on bounding box detection of cars on the KITTI dataset.
研究动机与目标
- 解决计算机视觉中深度学习模型训练面临的高标注成本和真实世界数据有限的挑战。
- 通过随机化提升合成数据的鲁棒性,以克服合成数据与真实世界数据之间的现实差距。
- 证明经领域随机化处理的合成数据在微调至真实数据后,其性能可超越仅使用真实数据训练的模型,以及高保真度的合成数据集。
- 研究不同DR参数和数据增强策略对检测性能的影响。
提出的方法
- 通过随机扰动光照、物体纹理、位姿和背景元素等仿真参数,在合成图像生成中应用领域随机化。
- 引入“飞行干扰物”——场景中随机移动的物体——以提升模型鲁棒性和检测精度。
- 在完全由合成DR数据构成的数据集上训练目标检测模型(如Faster R-CNN、R-FCN),初始训练阶段不使用任何真实世界数据。
- 将训练好的模型在少量真实世界数据(如KITTI)上进行微调,以适应真实世界的数据分布偏移。
- 在训练过程中采用随机颜色抖动、缩放和裁剪等数据增强策略,以进一步提升泛化能力。
- 比较不同初始化策略(ImageNet、COCO)和训练方案下的性能表现,以评估泛化能力和迁移能力。
实验结果
研究问题
- RQ1在合成数据上应用领域随机化是否能在真实世界目标检测基准上实现具有竞争力的性能?
- RQ2在合成DR数据上训练后,再在真实数据上微调,与仅在真实数据上训练相比,检测精度有何变化?
- RQ3哪些领域随机化参数(如光照、纹理、干扰物)对检测性能影响最大?
- RQ4与更高保真度的、照片级真实感的合成数据集相比,基于DR的合成数据在最终模型精度方面表现如何?
主要发现
- 使用COCO权重初始化的Faster R-CNN检测器,仅在领域随机化合成数据上训练,其在KITTI数据集上的平均精度(AP)达到83.7,优于在照片级真实感的Virtual KITTI数据集上训练的模型(AP:79.7)。
- 在真实KITTI数据上微调DR训练的模型,其性能优于仅在真实数据上训练的模型,证明了从合成数据到真实数据迁移的有效性。
- 在合成DR数据上训练时冻结早期层,性能最高下降13.5%,表明完整微调对最优适应至关重要。
- 在使用ImageNet预训练时,性能在约10,000张训练图像后趋于饱和;在无预训练时,约50,000张图像后趋于饱和,表明在使用DR时,高数据量并非关键因素。
- 引入“飞行干扰物”提升了检测精度,凸显了在领域随机化中动态场景变化的重要性。
- 在COCO上预训练(其包含车辆类别)相比随机初始化显著提升了性能,且DR进一步增强了这一增益,表明DR有助于跨领域学习更优特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。