[논문 리뷰] Object Detection using Domain Randomization and Generative Adversarial Refinement of Synthetic Images
이 논문은 유한한 실물 이미지와 풍부한 합성 데이터만을 사용하여 산업용 전기 부품을 위한 실시간에 가까운 객체 검출기 학습을 위해 도메인 랜덤라이제이션과 GAN 기반 이미지 정제를 조합한 하이브리드 접근법을 제안한다. 합성 이미지 생성 시 도메인 랜덤라이제이션을 적용하고, Cyclic-GAN을 사용해 합성 이미지를 실제 환경 분포에 맞게 정제함으로써, 무작위화된 합성 이미지와 GAN로 정제된 이미지를 결합한 결과, 실재 테스트 데이터에서 mAP가 0.95를 초과하는 성능을 달성하였다.
In this work, we present an application of domain randomization and generative adversarial networks (GAN) to train a near real-time object detector for industrial electric parts, entirely in a simulated environment. Large scale availability of labelled real world data is typically rare and difficult to obtain in many industrial settings. As such here, only a few hundred of unlabelled real images are used to train a Cyclic-GAN network, in combination with various degree of domain randomization procedures. We demonstrate that this enables robust translation of synthetic images to the real world domain. We show that a combination of the original synthetic (simulation) and GAN translated images, when used for training a Mask-RCNN object detection network achieves greater than 0.95 mean average precision in detecting and classifying a collection of industrial electric parts. We evaluate the performance across different combinations of training data.
연구 동기 및 목표
- 산업용 객체 검출에서 실세계 레이블이 부족한 문제를 해결하기 위해.
- 시뮬레이션 기반 훈련에서 합성 이미지와 실제 이미지 간의 현실성 격차를 줄이기 위해.
- 도메인 랜덤라이제이션과 GAN 기반 이미지 정제를 조합함으로써 검출기의 일반화 성능 향상 효과를 평가하기 위해.
- 단지 수백 장의 실물 이미지와 대량의 합성 데이터만을 사용하여 높은 mAP 성능을 달성하기 위해.
- 합성 데이터에 GAN 정제와 도메인 랜덤라이제이션을 적용한 것이 순수 합성 데이터나 순수 실물 데이터로만 훈련한 경우보다 우수한 성능을 낼 수 있음을 입증하기 위해.
제안 방법
- 합성 이미지는 물리 시뮬레이터(Bullet)와 레이 트레이서(POV-Ray)를 사용하여 생성되었으며, 조명, 물체 색상, 질감, 카메라 위치 등 렌더링 파라미터를 무작위로 설정하였다.
- 도메인 랜덤라이제이션은 정해진 3차원 부피 내에서 물체 색상, 질감, 시점 바닥, 카메라 위치를 다양화하여 훈련 분포의 다양성을 높이기 위해 적용되었다.
- 10,000장의 합성 이미지와 256장의 실물 이미지를 사용하여 Cyclic-GAN을 훈련시켰으며, 256×256 크기의 무작위 컷을 사용해 합성 이미지를 더 현실적인 도메인으로 변환하였다.
- 판별자는 두 개의 병렬 브랜치로 구성되었는데, 하나는 세부 정보를 위해 작은 수신장, 다른 하나는 전반적 맥락을 위해 큰 수신장을 갖추어 번역 과정에서 물체 색상을 유지하도록 하였다.
- 최종 모델은 원본 합성 데이터와 GAN으로 정제된 이미지를 동일한 초모수 설정으로 사용하여 Mask-RCNN 검출기를 훈련하기 위해 조합하였다.
- 성능 평가는 100장의 실물 테스트 이미지와 다양한 훈련 데이터 조합에 대해 0.5 IoU 기준 mAP를 사용하여 평가되었다.
실험 결과
연구 질문
- RQ1도메인 랜덤라이제이션만으로도 산업용 객체 검출에서 합성 데이터의 현실성 격차를 줄일 수 있는가?
- RQ2GAN 기반 이미지 번역만으로도 합성 데이터에서 실세계 데이터로의 일반화 성능을 향상시킬 수 있는가?
- RQ3도메인 랜덤라이제이션과 GAN 정제를 조합하면 각각의 방법을 별도로 사용할 때보다 더 높은 검출 성능을 낼 수 있는가?
- RQ4mAP를 최대화하기 위해 합성 데이터, 랜덤화된 데이터, GAN 정제된 데이터의 최적 조합은 무엇인가?
- RQ5수백 장의 실물 이미지를 포함시킬 경우, 주로 합성 데이터로만 훈련된 검출기의 성능에 어떤 영향을 미치는가?
주요 결과
- 고정된 색상과 질감을 가진 순수 합성 데이터로만 훈련한 결과 mAP가 0.812에 그쳐 실제 환경 조건으로의 일반화가 열악한 것으로 나타났다.
- 단지 GAN으로 정제된 합성 이미지(S_fix→real)만을 사용한 경우 mAP가 0.874로 향상되었지만 여전히 제한된 성능을 보였다.
- 20%의 S_fix→real과 80%의 S_rand+tex 조합이 0.955 mAP를 기록하여 모든 테스트 설정 중에서 가장 높은 성능를 달성하였다.
- S_fix→real과 S_rand+tex를 50:50으로 혼합한 경우 0.950 mAP를 기록하여 정제된 이미지와 랜덤화된 합성 이미지를 조합하는 것이 효과적임을 확인하였다.
- 다양한 수신장 크기를 가진 이중 판별자 아키텍처를 도입함으로써 GAN 번역 과정에서 색상 유지가 크게 향상되어 이전에 발생하던 실패 모드를 해결하였다.
- 단지 256장의 실물 이미지와 10,000장의 합성 이미지만을 사용하여도 실세계 테스트 데이터에서 mAP가 0.95를 초과하는 성능을 달성하여 강력한 제로샷 일반화 능력을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.