Skip to main content
QUICK REVIEW

[논문 리뷰] Weakly Supervised Object Discovery by Generative Adversarial & Ranking Networks

Ali Diba, Vivek Sharma|arXiv (Cornell University)|2017. 11. 22.
Generative Adversarial Networks and Image Synthesis참고 문헌 52인용 수 5
한 줄 요약

이 논문은 생성적 적대적 네트워크(GANs)를 사용하고, 혼잡한 시나리오에서 실제적인 객체 인스턴스를 합성하기 위해 순위 손실를 결합한 새로운 약한 지도 학습 객체 탐지 프레임워크를 제안한다. 유사도-순위 목표로 조건부 GAN을 훈련시킴으로써, 경계 상자 애너테이션 없이도 객체 특화 템플릿을 학습할 수 있으며, 이는 MS-COCO 및 PASCAL VOC 데이터셋에서 약한 지도 학습 객체 탐지 및 향상된 국소화 성능을 가능하게 한다.

ABSTRACT

The deep generative adversarial networks (GAN) recently have been shown to be promising for different computer vision applications, like image edit- ing, synthesizing high resolution images, generating videos, etc. These networks and the corresponding learning scheme can handle various visual space map- pings. We approach GANs with a novel training method and learning objective, to discover multiple object instances for three cases: 1) synthesizing a picture of a specific object within a cluttered scene; 2) localizing different categories in images for weakly supervised object detection; and 3) improving object discov- ery in object detection pipelines. A crucial advantage of our method is that it learns a new deep similarity metric, to distinguish multiple objects in one im- age. We demonstrate that the network can act as an encoder-decoder generating parts of an image which contain an object, or as a modified deep CNN to rep- resent images for object detection in supervised and weakly supervised scheme. Our ranking GAN offers a novel way to search through images for object specific patterns. We have conducted experiments for different scenarios and demonstrate the method performance for object synthesizing and weakly supervised object detection and classification using the MS-COCO and PASCAL VOC datasets.

연구 동기 및 목표

  • 실제 경계 상자 애너테이션 없이 생성 모델을 활용하여 약한 지도 학습 객체 탐지의 과제를 해결한다.
  • 이미지 수준의 레이블만을 사용하여 혼잡한 시나리오 내에서 객체 인스턴스를 탐지하고 실제적인 인스턴스를 합성한다.
  • 단일 이미지 내의 다수의 객체를 식별하기 위해 순위 목표를 통해 깊이 있는 유사도 메트릭을 학습한다.
  • 훈련을 위한 가짜 지도 신호로 사용 가능한 가짜 경계 상자 템플릿을 생성함으로써 객체 탐지 성능을 향상시킨다.
  • 환각된, GAN에 의해 생성된 객체 샘플을 지도 신호로 사용하여 약한 지도 학습 객체 탐지를 가능하게 한다.

제안 방법

  • 클래스 레이블과 공간 조건을 사용하여 장면에서 특정 객체 인스턴스를 합성하는 조건부 GAN 아키텍처를 제안한다.
  • 실제 객체와 생성된 객체의 특징 임bedding을 비교함으로써 더 현실적이고 구분 가능한 샘플을 생성하도록 유도하는 새로운 순위 손실를 도입한다.
  • CNN 인코더를 사용해 이미지 특징을 추출하고, 이를 생성자에서 객체 특화 패치를 생성하는 데 활용한다.
  • 판별자는 실제 이미지와 생성된 이미지를 구분하고, 순위 네트워크는 동일한 클래스의 생성 샘플이 다른 클래스의 샘플보다 더 유사하도록 보장한다.
  • 적대적 손실, 재구성 손실, 그리고 제안된 순위 손실를 포함한 다중 손실 구성 요소를 사용해 전체 파ip라인을 엔드 투 엔드로 훈련시킨다.
  • 훈련된 모델을 활용해 데이터 증강을 위한 합성 데이터를 생성하고, 이는 약한 지도 학습 환경에서의 탐지 성능 향상에 기여한다.

실험 결과

연구 질문

  • RQ1순위 목표를 가진 생성적 적대적 네트워크는 혼잡한 시나리오 내에서 개별 객체 인스턴스를 효과적으로 탐지하고 합성할 수 있는가?
  • RQ2경계 상자 애너테이션 없이도 제안된 방법이 약한 지도 학습 객체 탐지에서 얼마나 잘 성능을 내는가?
  • RQ3학습된 유사도 메트릭은 표준 GAN 또는 기준 방법에 비해 객체 국소화 및 분류 성능을 향상시키는가?
  • RQ4합성된 객체 템플릿은 약한 지도 학습 환경에서 객체 탐지기 훈련을 위한 효과적인 가짜 지도 신호로 기능하는가?
  • RQ5이 방법은 MS-COCO 및 PASCAL VOC와 같은 다양한 데이터셋에 대해 얼마나 일반화되는가?

주요 결과

  • VGG-16를 사용하여 합성 데이터를 활용한 MS-COCO 테스트 세트에서 46.4% mAP를 달성하여 이전의 약한 지도 학습 방법을 능가한다.
  • PASCAL VOC 2007에서 VGG-16를 사용할 경우 55.8% mAP를 기록하고, 데이터 증강을 적용하면 58.6% mAP에 도달하여 최신 기준 수준을 초월한다.
  • 'aero' 클래스에 대해 PASCAL VOC 2007에서 85.5%의 정확한 국소화 비율을 달성하여 강력한 국소화 능력을 입증한다.
  • 순위 손실는 특징의 구분 능력을 크게 향상시켜 더 나은 일반화와 더 현실적인 객체 생성을 이끌어낸다.
  • 순위 손실가 없는 기준 대비 PASCAL VOC에서 최대 6.5%의 mAP 향상을 기록하여 효과적인 약한 지도 학습 탐지가 가능하다.
  • GAN를 사용해 추가 훈련 데이터를 합성함으로써 탐지 성능이 향상되며, 이는 대규모 데이터셋 확장 잠재력이 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.