Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Object Discovery and Co-Localization by Deep Descriptor Transforming

Xiu-Shen Wei, Chen-Lin Zhang|arXiv (Cornell University)|2017. 07. 20.
Advanced Image and Video Retrieval Techniques참고 문헌 4인용 수 7
한 줄 요약

이 논문은 사전 훈련된 CNN 활성화를 탐지기로 활용하여 레이블이 없는 이미지 세트 간에 공통 객체를 동시 국소화하는 새로운 비지도 학습 방법인 딥 디스크립터 트랜스포밍(DDT)을 제안한다. 상호 이미지 간 상관관계 평가를 위해 딥 디스크립터를 변환함으로써 DDT는 이미지 동시 국소화에서 최신 기술 수준의 성능을 달성하며, 최소한의 인간 레이블링으로 인식 및 검출 성능을 향상시키기 위한 강력하고 확장 가능한 웹 이미지 수확을 가능하게 한다.

ABSTRACT

Reusable model design becomes desirable with the rapid expansion of computer vision and machine learning applications. In this paper, we focus on the reusability of pre-trained deep convolutional models. Specifically, different from treating pre-trained models as feature extractors, we reveal more treasures beneath convolutional layers, i.e., the convolutional activations could act as a detector for the common object in the image co-localization problem. We propose a simple yet effective method, termed Deep Descriptor Transforming (DDT), for evaluating the correlations of descriptors and then obtaining the category-consistent regions, which can accurately locate the common object in a set of unlabeled images, i.e., unsupervised object discovery. Empirical studies validate the effectiveness of the proposed DDT method. On benchmark image co-localization datasets, DDT consistently outperforms existing state-of-the-art methods by a large margin. Moreover, DDT also demonstrates good generalization ability for unseen categories and robustness for dealing with noisy data. Beyond those, DDT can be also employed for harvesting web images into valid external data sources for improving performance of both image recognition and object detection.

연구 동기 및 목표

  • 클래스 레이블이나 객체 제안 없이 이미지 세트에서 비지도 학습을 통한 객체 탐지 문제를 해결한다.
  • 특히 컨volutional 활성화를 객체 탐지기로 사용하는 것과 같은 기능을 초과하여 사전 훈련된 CNN의 활용 가능성을 탐색한다.
  • 예측할 수 없는 카테고리에 잘 일반화되고 노이즈가 많은 웹 기반 이미지에 효과적으로 대응할 수 있는 방법을 개발한다.
  • DDT로 처리한 웹 이미지를 활용해 이미지 인식 및 객체 검출을 위한 자동 데이터 증강을 가능하게 한다.
  • 고품질 외부 훈련 데이터를 생성하기 위해 스케일이 가능하고 레이블이 없는 도구를 통해 웹 이미지를 수확하고 정제하는 것을 가능하게 한다.

제안 방법

  • 여러 층에서 사전 훈련된 CNN(예: VGG-16)의 딥 컨볼루션 디스크립터를 추출한다.
  • 주성분 분석(PCA)을 사용해 디스크립터를 새로운 공간으로 변환하여 이미지 간 디스크립터 상관관계를 평가한다.
  • 첫 번째 주성분(P¹)을 공통 객체를 이미지 간에 국소화하는 지표 행렬로 사용한다.
  • 이미지 간 투표 메커니즘을 적용하여 일관되고 카테고리 일관성이 있는 객체 국소화 마스크를 생성한다.
  • 정확도와 강건성을 향상시키기 위해 다수의 CNN 층을 앙상블하여 활용한다.
  • 두 번째 주성분(P²)을 활용해 잠재적인 부분 기반 국소화를 수행하며, 구조적 하위 영역(예: 바퀴, 머리)을 드러낸다.

실험 결과

연구 질문

  • RQ1사전 훈련된 CNN 활성화가 비지도 이미지 동시 국소화에서 공통 객체에 대해 효과적인 탐지기로 기능할 수 있는가?
  • RQ2DDT는 비지도 객체 탐지 및 약한 지도 학습 국소화에서 최신 기술 수준의 방법과 비교해 어떻게 성능을 냈는가?
  • RQ3DDT는 ImageNet에 포함되지 않은 새로운 카테고리로 얼마나 잘 일반화되는가?
  • RQ4DDT는 목표 객체를 포함하지 않는 노이즈가 많은 이미지를 효과적으로 탐지하고 필터링할 수 있는가?
  • RQ5DDT를 사용해 웹 이미지에서 자동으로 바운딩 박스와 정제된 데이터를 생성하여 후속 인식 및 검출 모델의 성능을 향상시킬 수 있는가?

주요 결과

  • DDT는 지도 학습 없이도 기존 최신 기술 수준의 방법보다 이미지 동시 국소화에서 뚜렷한 승리를 거두었으며, 벤치마크 데이터셋에서 더 높은 mAP를 달성했다.
  • PASCAL VOC 2007 테스트 세트에서 DDT+07++12는 표준 07+12 훈련 세트 대비 mAP를 2.8% 향상시켰다.
  • VOC 2012에서 DDT 증강은 07++12보다 4% 높은 mAP를 기록했으며, COCO(12만 개의 인간 레이블링 이미지)로 훈련된 모델에 비해 경쟁 가능한 성능을 보였다.
  • DDT는 새로운 카테고리로의 일반화 능력이 뛰어나고 노이즈가 많은 이미지에 대해 강건하여 관련 없는 이미지를 효과적으로 식별하고 필터링했다.
  • 이 방법은 1만 개의 웹 이미지와 자동으로 생성된 바운딩 박스를 포함한 새로운 객체 검출 데이터셋인 WebVOC를 성공적으로 생성했으며, PASCAL VOC와 동일한 규모와 카테고리 세트를 확보했다.
  • 두 번째 주성분(P²)은 의미 있는 부분 수준의 구조(예: 바퀴, 머리)를 드러내어 향후 부분 기반 동시 국소화에 잠재적인 가능성을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.