Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Part Segmentation Performance by Optimising Realism of Synthetic Images using Cycle Generative Adversarial Networks

R. Barth, J. Hemming|arXiv (Cornell University)|2018. 03. 16.
Smart Agriculture and AI참고 문헌 21인용 수 13
한 줄 요약

이 논문은 순환 GAN(Cycle-GAN)을 사용하여 합성 농업 이미지의 현실성 향상을 제안하며, 이는 컨volutional 신경망을 통한 더 나은 의미적 부분 분할을 가능하게 한다. 색상과 질감 측면에서 실측 이미지 분포를 따라 합성 이미지를 변환함으로써 성능 향상을 이룬다: 미세조정(fine-tuning)을 사용할 경우 52%의 평균 IOU를 달성하고, 실측 데이터의 미세조정 없이도 31%의 IOU를 기록하여 합성 데이터만으로 학습한 경우 대비 55% 향상된 성능을 보였다.

ABSTRACT

In this paper we report on improved part segmentation performance using convolutional neural networks to reduce the dependency on the large amount of manually annotated empirical images. This was achieved by optimising the visual realism of synthetic agricultural images.In Part I, a cycle consistent generative adversarial network was applied to synthetic and empirical images with the objective to generate more realistic synthetic images by translating them to the empirical domain. We first hypothesise and confirm that plant part image features such as color and texture become more similar to the empirical domain after translation of the synthetic images.Results confirm this with an improved mean color distribution correlation with the empirical data prior of 0.62 and post translation of 0.90. Furthermore, the mean image features of contrast, homogeneity, energy and entropy moved closer to the empirical mean, post translation. In Part II, 7 experiments were performed using convolutional neural networks with different combinations of synthetic, synthetic translated to empirical and empirical images. We hypothesised that the translated images can be used for (i) improved learning of empirical images, and (ii) that learning without any fine-tuning with empirical images is improved by bootstrapping with translated images over bootstrapping with synthetic images. Results confirm our second and third hypotheses. First a maximum intersection-over-union performance was achieved of 0.52 when bootstrapping with translated images and fine-tuning with empirical images; an 8% increase compared to only using synthetic images. Second, training without any empirical fine-tuning resulted in an average IOU of 0.31; a 55% performance increase over previous methods that only used synthetic images.

연구 동기 및 목표

  • 농업 로봇 분야에서 의미적 분할 모델을 훈련하기 위해 대규모 애너테이션을 갖춘 실측 이미지 데이터셋에 대한 의존도를 줄이기 위해.
  • 합성 이미지와 실제 세계의 농업 이미지 사이의 도메인 갭(domain gap)을 해결하여 합성 데이터 기반 부트스트랩핑의 성능을 제한하는 문제를 해결하기 위해.
  • 합성 식물 이미지의 현실성을 향상시켜 색상, 질감, 시각적 외관 측면에서 실측 이미지 분포와 더 잘 일치시키기 위해.
  • 변환된 합성 이미지가 원본 합성 이미지보다 컨volutional 신경망(CNN)의 부분 분할 훈련에서 더 우수한 성능을 내는지 조사하기 위해.
  • 실측 데이터의 미세조정 없이도 변환된 이미지로만 훈련한 모델이 원래 합성 데이터만으로 훈련한 것보다 유의미하게 높은 성능을 내는지 입증하기 위해.

제안 방법

  • 쌍이 없는 데이터를 사용하여 순환 일致성 있는 생성 적대 신경망(Cycle-GAN)을 적용해 합성 농업 이미지를 실측 이미지 도메인으로 변환한다.
  • 쌍이 없는 합성 이미지와 실측 이미지를 사용하여 Cycle-GAN을 훈련시키며, 변환 과정에서 구조적 신뢰성을 유지하기 위해 순환 일치성(cycle consistency)을 활용한다.
  • 생성자(generator)와 판별자(discriminator) 네트워크를 적대적 손실(adversarial loss)과 순환 일치성 손실(cycle-consistency loss)을 최적화하여 사진 수준의 현실감 있는 번역 결과를 도출한다.
  • 원본 합성 이미지, 변환된 합성 이미지, 실측 이미지 간의 이미지 특징(색상, 대비, 균일성, 에너지, 엔트로피)을 추출하고 비교하여 현실감 향상 정도를 정량화한다.
  • 세 가지 데이터 조합(합성 데이터만, 합성 데이터를 실측 도메인으로 변환한 후, 실측 데이터만)을 사용해 깊이 컨volution 신경망(CNN)을 훈련하고 평가한다.
  • 모든 훈련 및 미세조정 설정에서 의미적 분할 성능을 평가하기 위해 교차율(IOU)을 주요 평가 지표로 사용한다.

실험 결과

연구 질문

  • RQ1Cycle-GAN 변환을 통해 합성 이미지와 실측 이미지 간의 색상 및 질감 특성 측면에서 시각적 도메인 갭을 줄일 수 있는가?
  • RQ2Cycle-GAN로 변환된 합성 이미지를 사용할 경우, 원본 합성 이미지로만 훈련하는 것보다 실제 세계(실측) 이미지에 대한 의미적 부분 분할 성능이 향상되는가?
  • RQ3실측 데이터에 대한 어떤 미세조정 없이도, 변환된 합성 이미지로만 훈련된 CNN 모델이 실측 데이터에 효과적으로 일반화되는가?
  • RQ4합성 이미지를 실측 도메인으로 변환한 후 부트스트랩핑 전략을 사용할 경우, 원본 합성 이미지만 사용하는 것에 비해 성능 향상은 어느 정도인가?
  • RQ5실측 데이터로 미세조정된 모델과 비교해, 변환된 이미지로만 훈련된 모델의 평균 IOU 및 클래스별 분할 정확도는 어떻게 되는가?

주요 결과

  • Cycle-GAN 변환 후, 합성 이미지와 실측 이미지 간의 평균 색상 분포 상관관계가 0.62에서 0.90으로 향상되어 시각적 현실감 향상이 확인되었다.
  • 변환된 이미지에서 대비, 균일성, 에너지, 엔트로피 등의 이미지 특징이 실측 평균 값에 더 가까워졌으며, 이는 질감의 현실감 향상이 확인됨을 의미한다.
  • 실측 데이터의 미세조정 없이도 변환된 합성 이미지로만 훈련한 CNN은 평균 IOU 0.31을 달성했으며, 이는 원본 합성 이미지만으로 훈련한 경우(0.20) 대비 55% 향상된 성능이다.
  • 소규모 실측 데이터로 변환된 합성 이미지로 훈련한 모델을 미세조정한 결과 가장 높은 성능을 기록했으며, 이는 합성 데이터로만 훈련한 경우(0.48) 대비 8% 향상되었고, 실측 데이터로만 훈련한 경우(0.41) 대비 27% 향상된 결과를 보였다.
  • 컷 클래스(cut class)는 가장 뚜렷한 향상을 보였으며, 실측 데이터로만 훈련한 경우 대비 118% 높은 IOU를 기록했고, 실측 데이터로만 훈련한 경우 대비 600% 높은 IOU를 기록했다.
  • 정성적 결과를 통해 변환된 합성 이미지가 실제 세계 이미지와 유사하게 보이며, 미세한 아티팩트 외에는 실측 이미지와 유사한 외관을 유지했고, 원본 합성 데이터의 진짜 분할 레이블도 잘 유지되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.