Skip to main content
QUICK REVIEW

[논문 리뷰] Analysis of Training Object Detection Models with Synthetic Data

Bram Vanherle, Steven Moonen|arXiv (Cornell University)|2022. 11. 29.
Advanced Neural Network Applications인용 수 5
한 줄 요약

이 논문은 DIMO 데이터셋에서 데이터 생성 전략과 훈련 기법을 분석함으로써 합성 데이터를 객체 검출 모델 훈련에 효과적으로 사용하는 방법을 조사한다. 연구 결과, 미세조정을 통해 소량의 진짜 데이터를 조합하면 성능이 크게 향상되며, 이는 83.7 mAP를 기록하여 진짜 데이터로만 훈련된 모델를 뛰어넘는다. 또한, 실제 도메인과 일치하는 조건에서 전이 학습을 수행할 경우, 전체 네트워크 재학습이 특성 추출기 고정 미세조정보다 성능이 뛰어나다.

ABSTRACT

Recently, the use of synthetic training data has been on the rise as it offers correctly labelled datasets at a lower cost. The downside of this technique is that the so-called domain gap between the real target images and synthetic training data leads to a decrease in performance. In this paper, we attempt to provide a holistic overview of how to use synthetic data for object detection. We analyse aspects of generating the data as well as techniques used to train the models. We do so by devising a number of experiments, training models on the Dataset of Industrial Metal Objects (DIMO). This dataset contains both real and synthetic images. The synthetic part has different subsets that are either exact synthetic copies of the real data or are copies with certain aspects randomised. This allows us to analyse what types of variation are good for synthetic training data and which aspects should be modelled to closely match the target data. Furthermore, we investigate what types of training techniques are beneficial towards generalisation to real data, and how to use them. Additionally, we analyse how real images can be leveraged when training on synthetic images. All these experiments are validated on real data and benchmarked to models trained on real data. The results offer a number of interesting takeaways that can serve as basic guidelines for using synthetic data for object detection. Code to reproduce results is available at https://github.com/EDM-Research/DIMO_ObjectDetection.

연구 동기 및 목표

  • 실제 도메인 객체 검출에 대한 일반화를 향상시키는 데 효과적인 합성 데이터 생성 전략을 규명하기 위해.
  • 합성 데이터 훈련을 위한 전이 학습 및 데이터 증강과 같은 훈련 기법을 평가하기 위해.
  • 진짜 이미지를 합성 훈련 파이프라인에 통합하는 최적의 방법을 규명하기 위해.
  • 실제 테스트 데이터에서 합성 데이터 전용, 진짜 데이터 전용, 하이브리드 모델의 성능을 벤치마킹하기 위해.
  • 산업 및 연구 분야에서 합성 데이터를 객체 검출에 실용적으로 적용할 수 있도록 지침을 제공하기 위해.

제안 방법

  • 실험은 실제 이미지, 정확한 합성 복제본, 그리고 무작위 조명, 자세, 텍스처를 적용한 합성 변형 셋을 포함하는 DIMO 데이터셋에서 수행되었다.
  • 표준 객체 검출 아키텍처를 사용하여 데이터 증강 및 전이 학습을 적용하고, 특성 추출기 고정 여부를 비교함으로써 훈련을 수행하였다.
  • 진짜 데이터 통합 전략 두 가지를 평가하였는데, 훈련 중 진짜 및 합성 데이터를 혼합하는 것과, 사전 훈련된 합성 모델을 진짜 데이터로 미세조정하는 것이었다.
  • 성능 평가에는 보류된 진짜 테스트 세트에서의 평균 평균 정확도(mAP)를 사용하였으며, 데이터 비율 및 변형 유형에 대한 분석 실험을 수행하였다.
  • 모든 실험은 고정된 총 데이터셋 크기 3510장으로 수행되었으며, 진짜 대 합성 비율을 1:9에서 1:1까지 변화시켜 확장성과 효율성을 평가하였다.
  • 모든 실험은 실제 도메인 데이터로 검증되어 실용적 관련성과 도메인 일반화 능력을 확보하였다.

실험 결과

연구 질문

  • RQ1조명, 자세, 텍스처와 같은 합성 데이터의 어떤 변형이 실제 이미지로의 일반화에 가장 효과적인가?
  • RQ2합성 데이터 훈련 시, 전체 네트워크를 미세조정하는 것이 특성 추출기 고정보다 성능을 뛰어나게 하는가?
  • RQ3소량의 진짜 데이터를 합성 데이터와 조합하여 실제 도메인 성능을 향상시키는 데 얼마나 효과적인가?
  • RQ4실제 테스트 세트에서 mAP를 최대화하기 위해 진짜 데이터와 합성 데이터의 최적 비율은 무엇인가?
  • RQ5실제 데이터를 정밀하게 복제하는 것보다, 합성 데이터 생성 시 도메인 랜덤라이제이션을 적용하면 더 나은 일반화 성능을 얻을 수 있는가?

주요 결과

  • 완전히 무작위로 생성된 합성 데이터로 사전 훈련한 모델에 진짜 이미지 10%만으로도 미세조정을 수행한 결과, 82.05 mAP를 기록하여 진짜 데이터 전용 기준선보다 약 5점 높은 성능을 달성하였다.
  • 최고의 성능을 보인 하이브리드 모델은 진짜 데이터와 합성 데이터를 1:1 비율로 사용하며, 미세조정을 통해 83.7 mAP를 기록하여 합성 데이터 전용 및 진짜 데이터 전용 모델 모두를 능가하였다.
  • 훈련 중 진짜 및 합성 데이터를 혼합한 결과, 진짜 데이터 비율이 작더라도 성능 향상이 있었으며, 합성 대 진짜 비율이 5:1일 때 80.13 mAP로 최고 성능을 기록하였다.
  • 전체 네트워크(특성 추출기 포함)를 재학습하는 전이 학습 방식이 특성 추출기 고정 방식보다 더 좋은 성능을 보였으며, 이는 일부 이전 연구와는 반대되는 결과였다.
  • 합성 데이터의 조명 및 자세 조건을 실제 도메인과 일치시켰을 때 성능 향상이 있었지만, 이는 전체 미세조정과 함께 적용되었을 때에만 효과를 발휘하였다.
  • 결과적으로, 합성 데이터는 최소한의 진짜 데이터와 함께, 특히 미세조정을 통해 사용될 경우 매우 효과적임을 입증하였으며, 높은 성능의 모델을 비용 효율적으로 구축할 수 있는 길을 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.