Skip to main content
QUICK REVIEW

[논문 리뷰] Emergence of Object Segmentation in Perturbed Generative Models

Adam Bielski, Paolo Favaro|Bern Open Repository and Information System (University of Bern)|2019. 05. 29.
Generative Adversarial Networks and Image Synthesis참고 문헌 33인용 수 16
한 줄 요약

이 논문은 무작위 이동을 통해 생성 모델을 훈련시켜 전경과 배경의 분리된 표현을 학습하도록 유도하는 완전히 비지도 학습 방법을 제안한다. GAN을 사용해 배경, 전경, 마스크로 이루어진 층화된 장면을 생성하고, 실제 이미지를 이 잠재 공간으로 역으로 변환하는 인코더를 훈련시킴으로써, 수동 애너테이션이나 사전 훈련된 검출기 없이도 최신 비지도 분할 성능을 달성한다.

ABSTRACT

We introduce a novel framework to build a model that can learn how to segment objects from a collection of images without any human annotation. Our method builds on the observation that the location of object segments can be perturbed locally relative to a given background without affecting the realism of a scene. Our approach is to first train a generative model of a layered scene. The layered representation consists of a background image, a foreground image and the mask of the foreground. A composite image is then obtained by overlaying the masked foreground image onto the background. The generative model is trained in an adversarial fashion against a discriminator, which forces the generative model to produce realistic composite images. To force the generator to learn a representation where the foreground layer corresponds to an object, we perturb the output of the generative model by introducing a random shift of both the foreground image and mask relative to the background. Because the generator is unaware of the shift before computing its output, it must produce layered representations that are realistic for any such random perturbation. Finally, we learn to segment an image by defining an autoencoder consisting of an encoder, which we train, and the pre-trained generator as the decoder, which we freeze. The encoder maps an image to a feature vector, which is fed as input to the generator to give a composite image matching the original input image. Because the generator outputs an explicit layered representation of the scene, the encoder learns to detect and segment objects. We demonstrate this framework on real images of several object categories.

연구 동기 및 목표

  • 수동 애너테이션, 바운딩 박스, 사전 훈련된 검출기를 모두 사용하지 않는 완전히 비지도 객체 분할 방법을 개발하는 것.
  • 객체 분할을 전경이 배경에 대해 局부적으로 이동해도 현실감을 유지할 수 있는 원칙에 기반하여 정의하는 것.
  • 전경 위치의 무작위 변형에 대해도 현실감 있는 상태를 유지하는 층화된 장면 표현(배경, 전경, 마스크)을 생성하는 생성 모델을 훈련하는 것.
  • 사전 훈련된 생성자 G의 잠재 공간으로 실제 이미지를 매핑하는 인코더 네트워크를 훈련시켜 종단 간 비지도 분할을 가능하게 하는 것.
  • LSUN Cars 및 CUB-200와 같은 실제 데이터셋에서의 성능을 입증하여, 감독 없이도 경쟁적인 mIoU 점수를 달성하는 것.

제안 방법

  • 생성자(G)와 판별자(D)를 사용한 적대적 설정에서, 배경(B), 전경(F), 마스크(m)로 구성된 트리플릿으로부터 현실적인 복합 이미지를 생성하도록 생성 모델을 훈련한다.
  • 훈련 중 전경과 마스크에 입력에 의존하지 않는 무작위 이동(p)을 도입하여, G가 왜곡 후에도 유효한 현실적인 분리된 객체 분할을 학습하도록 유도한다.
  • 사전 훈련된 생성자 G를 자동차오디오 셋업에서 디코더로 사용하며, 인코더 E가 실제 이미지를 G를 통해 입력을 재구성할 수 있는 잠재 코드 z로 매핑하도록 한다.
  • 사전 훈련된 판별자에서 추출한 특징을 기반으로 한 인지적 손실과 입력과 생성된 이미지 간의 차이를 최소화하는 재구성 손실을 사용해 인코더 E를 훈련한다.
  • 다중 해상도 잠재 코드 표현을 사용: 5개의 해상도, 각 해상도당 2개의 AdaIN 코드, 배경과 전경에 별도의 코드를 할당하여 총 20개의 512차원 잠재 코드를 사용한다.
  • 훈련된 인코더를 실제 이미지에 적용하여, 지도 학습 애너테이션 없이도 객체 마스크를 추출하며, 생성자의 명시적 층화 출력을 활용한다.

실험 결과

연구 질문

  • RQ1전경을 배경에 대해 무작위로 공간 이동시키는 조건에서 생성 모델을 훈련시킬 경우, 객체 분할이 자동으로 유도될 수 있는가?
  • RQ2고정된 사전 훈련된 생성자와 함께 비지도 자동차오디오 셋업을 사용할 경우, 수동 애너테이션 없이도 실제 이미지의 객체를 탐지하고 분할할 수 있는가?
  • RQ3복잡한 객체 형태와 배경을 가진 실제 데이터셋에서 이 방법은 어떤 성능을 보이며, 감독 기반 기준선과 비교해 어떻게 성능을 내는가?
  • RQ4현재 GAN의 한계로 인해 다중 객체 카테고리 데이터에서 성능이 떨어지더라도, 이 프레임워크는 다양한 객체 유형으로 일반화 가능한가?
  • RQ5분할 품질이 생성자 역전환의 가능성과 인코더 훈련의 안정성에 얼마나 의존하는가?

주요 결과

  • LSUN Car 데이터셋에서 이 방법은 수동 애너테이션 없이도 Mask R-CNN 같은 감독 기반 방법과 비교해 경쟁적인 평균 교차율(mIoU) 성능을 달성한다.
  • CUB-200 데이터셋에서는 지도 학습 기준으로 사용된 지도 애너테이션을 기준으로 mIoU 0.51을 기록하여 세밀한 새 분할에서 뛰어난 성능을 보였다.
  • 생성자 훈련 중 무작위 변형을 적용함으로써, 동일한 전경과 배경 또는 빈 마스크와 같은 비의미적인 해법을 방지하여 의미 있는 객체 수준의 분리 표현 학습을 유도하였다.
  • 정성적 결과에서는 혼합 데이터셋에서 훈련된 모델이 자동차, 말 등 다양한 객체 유형으로 잘 일반화됨을 보였지만, 단일 카테고리 데이터에 비해 이미지 품질은 낮았다.
  • 이미지를 100개의 소형 배치로 처리함으로써 인코더 훈련이 안정화되었으며, 생성자 역전환의 다중해석 문제에 대해서도 강인함을 보였지만, 소형 객체는 여전히 도전 과제로 남아 있었다.
  • 생성된 복합 이미지의 Fréchet Inception Distance(FID)는 표준 StyleGAN과 유사하여, 층화되고 변형된 훈련 방식의 제약에도 불구하고 높은 현실감을 유지함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.