Skip to main content
QUICK REVIEW

[论文解读] Synthetic Data Generation and Adaption for Object Detection in Smart Vending Machines

Kai Wang, Fuyuan Shi|arXiv (Cornell University)|Apr 28, 2019
Advanced Neural Network Applications参考文献 29被引用 6
一句话总结

本文提出了一种新颖的流水线,用于生成和适应合成数据,以提升智能自动售货机中的目标检测性能。通过在3D虚拟环境中模拟复杂的物体布局和鱼眼相机畸变,并应用风格迁移生成网络使合成图像与真实数据分布对齐,该方法显著提升了检测mAP——仅需每类200张合成样本即可达到接近最优的性能,优于未经适应的合成数据,同时减少了对昂贵的真实数据采集的依赖。

ABSTRACT

This paper presents an improved scheme for the generation and adaption of synthetic images for the training of deep Convolutional Neural Networks(CNNs) to perform the object detection task in smart vending machines. While generating synthetic data has proved to be effective for complementing the training data in supervised learning methods, challenges still exist for generating virtual images which are similar to those of the complex real scenes and minimizing redundant training data. To solve these problems, we consider the simulation of cluttered objects placed in a virtual scene and the wide-angle camera with distortions used to capture the whole scene in the data generation process, and post-processed the generated images with a elaborately-designed generative network to make them more similar to the real images. Various experiments have been conducted to prove the efficiency of using the generated virtual images to enhance the detection precision on existing datasets with limited real training data and the generalization ability of applying the trained network to datasets collected in new environment.

研究动机与目标

  • 解决智能自动售货机目标检测任务中真实世界训练数据稀缺的问题。
  • 在合成数据生成中模拟具有杂乱物体布局和广角相机畸变的真实场景。
  • 通过在训练前将合成图像的风格适配至真实世界数据分布,提升其真实性。
  • 通过提升合成数据的质量和泛化能力,减少对大规模真实数据标注的依赖。
  • 在域内和域外测试集上验证该方法的有效性,证明其具备强大的泛化能力。

提出的方法

  • 重建智能自动售货机的3D内部结构以及真实产品的高保真3D模型,用于虚拟场景构建。
  • 在虚拟场景中以复杂且逼真的布局排列物体,并通过变化光照条件来模拟真实世界中的可变性。
  • 模拟具有几何畸变的广角鱼眼镜头相机,以匹配真实世界的成像条件。
  • 通过围绕真实世界参数随机排列相机参数、物体位置和环境因素,生成合成图像。
  • 应用生成对抗网络(GAN)将真实图像的风格迁移至合成图像,使其分布与真实数据对齐。
  • 自动为适配后的合成图像中的物体生成边界框标注,支持端到端训练。

实验结果

研究问题

  • RQ1结合真实相机建模和物体布局的合成数据生成,能否提升智能自动售货机中的目标检测性能?
  • RQ2风格迁移在缩小合成图像与真实图像之间的域差距方面,对目标检测的效用如何?
  • RQ3在训练前进行数据适配,能否在保持或提升检测准确率的同时,减少对真实标注数据的需求?
  • RQ4在经过适配的合成数据上训练的模型,能否泛化到具有不同光照、背景和布局的新环境?
  • RQ5在最小化数据采集工作量的前提下,如何实现合成数据与真实数据的最佳平衡以最大化检测mAP?

主要发现

  • 当使用相同数量的合成数据和真实数据时,所提出的方法将平均精度均值(mAP)提升了近2个百分点,证明了更高的数据效率。
  • 在仅使用每类200张合成样本的情况下,经风格迁移适配的合成数据训练的模型即可达到最优mAP,而未经适配的合成数据则需500张样本才能达到相似性能。
  • 适配后的合成数据在来自不同售货机层的新测试集上表现出良好的泛化能力,与真实数据结合后mAP达到近89。
  • 数据适配步骤显著减少了对真实数据的需求,因为即使在数据量较低的情况下,基于适配合成数据训练的模型也优于基于原始合成数据训练的模型。
  • 该方法在多种检测架构(PVANET、SSD、YOLOv3)上均表现出鲁棒性,尤其在遮挡或畸变物体的检测中,精度提升一致且显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。