Skip to main content
QUICK REVIEW

[논문 리뷰] How much real data do we actually need: Analyzing object detection performance using synthetic and real data

Farzan Erlik Nowruzi, Prince Kapoor|arXiv (Cornell University)|2019. 07. 16.
Advanced Neural Network Applications참고 문헌 46인용 수 67
한 줄 요약

이 논문은 자율주행에서 SSD-MobileNet 객체 탐지를 위해 합성 데이터가 실제 데이터를 대체하거나 보완할 수 있는지 분석하고, 제한된 실제 데이터로 성능을 극대화하기 위한 학습 전략(혼합 학습과 미세조정)을 제안한다.

ABSTRACT

In recent years, deep learning models have resulted in a huge amount of progress in various areas, including computer vision. By nature, the supervised training of deep models requires a large amount of data to be available. This ideal case is usually not tractable as the data annotation is a tremendously exhausting and costly task to perform. An alternative is to use synthetic data. In this paper, we take a comprehensive look into the effects of replacing real data with synthetic data. We further analyze the effects of having a limited amount of real data. We use multiple synthetic and real datasets along with a simulation tool to create large amounts of cheaply annotated synthetic data. We analyze the domain similarity of each of these datasets. We provide insights about designing a methodological procedure for training deep networks using these datasets.

연구 동기 및 목표

  • 실제 데이터를 축소하는 것이 객체 탐지 성능에 미치는 영향을 평가한다.
  • 데이터셋 분포/다양성과 모델 정확도 간의 관계를 연구한다.
  • 합성 데이터와 실제 데이터의 혼합 학습과 실제 데이터로의 미세 조정(미세조정)을 비교 평가한다.
  • 대규모 합성 데이터와 소규모 실제 데이터로 학습할 때의 절차적 지침을 제시한다.
  • 여러 개의 합성 데이터 세트를 결합하는 것이 실제 데이터 일반화에 미치는 영향을 조사한다.

제안 방법

  • 차량 및 보행자 클래스를 대상으로 실제 및 합성 데이터 세트를 혼합하여 SSD-MobileNet을 학습한다.
  • 실제 데이터 비율(100%, 10%, 5%, 2.5%)과 합성 대 실제 비율을 체계적으로 변화시킨다.
  • IoU 임계값 0.5–0.95를 0.05 간격으로 설정하여 정밀도/재현율로 평가한다.
  • 합성 데이터로 사전 학습한 뒤 실제 데이터로 미세 조정하는 전이 학습을 수행한다.
  • 혼합 학습과 미세 조정, 데이터 세트 조합을 비교한다.

실험 결과

연구 질문

  • RQ1실제 학습 데이터를 축소하는 것이 데이터 세트 전반에서 객체 탐지 성능에 어떤 영향을 미치는가?
  • RQ2합성 데이터 세트가 실제 데이터에 일반화되는 모델을 학습시키는 능력에서 어떤 차이를 보이는가?
  • RQ3동등한 실제 데이터 수준에서 합성 데이터를 실제 데이터와 혼합하는 것이 실제 데이터만 학습하는 것보다 성능을 개선하는가?
  • RQ4합성 사전학습 후 실제 데이터로의 미세 조정이 혼합 학습보다 더 효과적인가?
  • RQ5여러 합성 데이터 세트를 결합하는 것이 실제 데이터 일반화에 미치는 영향은 무엇인가?

주요 결과

  • 실제 데이터를 대폭 축소하면 차량 및 보행자 탐지 모두에서 정밀도와 재현율이 악화된다.
  • 보행자 탐지는 변형성과 다양성으로 인해 데이터 축소에 더 민감하다.
  • 합성 데이터를 사용한 혼합 학습은 실제 데이터의 일부만 사용하는 것보다 성능이 향상되지만, 합성 사전학습 후의 미세 조정이 더 큰 이득을 주며 특히 보행자 클래스에서 더 큼.
  • 전이 학습(합성 사전학습 후 실제 데이터 미세 조정)은 혼합 학습보다 더 안정적인 이득과 더 나은 재현율을 제공한다.
  • 여러 합성 데이터 세트를 결합하는 것이 일반적으로 단일 합성 소스보다 더 나은 결과를 낳지만, BDD와 같은 일부 실제 데이터 세트에서는 예외가 있다.
  • 7D(순수 합성)는 미세 조정 후 실제 데이터와 잘 매칭되나, 환경/카메라 모델이 덜 정확한 CARLA는 성능이 떨어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.