Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Image Clustering With Multiple Pretrained CNN Feature Extractors

Joris Guérin, Boots, Byron|arXiv (Cornell University)|2018. 07. 20.
Advanced Clustering Algorithms Research참고 문헌 21인용 수 14
한 줄 요약

이 논문은 다수의 사전 훈련된 CNN을 보완적인 시각으로 활용하여 이미지 클러스터링 성능을 향상시키기 위한 이단계적 접근을 제안한다. 이후 종단 간 다중 입력 신경망(DMVC)을 사용해 클러스터링과 특징 학습을 동시에 최적화한다. 이 방법은 단일 특징 추출기의 임의적 선택을 제거하고 종단 간 훈련을 통해 통합된 고밀도 표현을 학습함으로써 VOC2007, COIL100, UMist 데이터셋에서 최신 기준 성능을 달성한다.

ABSTRACT

For many image clustering problems, replacing raw image data with features extracted by a pretrained convolutional neural network (CNN), leads to better clustering performance. However, the specific features extracted, and, by extension, the selected CNN architecture, can have a major impact on the clustering results. In practice, this crucial design choice is often decided arbitrarily due to the impossibility of using cross-validation with unsupervised learning problems. However, information contained in the different pretrained CNN architectures may be complementary, even when pretrained on the same data. To improve clustering performance, we rephrase the image clustering problem as a multi-view clustering (MVC) problem that considers multiple different pretrained feature extractors as different "views" of the same data. We then propose a multi-input neural network architecture that is trained end-to-end to solve the MVC problem effectively. Our experimental results, conducted on three different natural image datasets, show that: 1. using multiple pretrained CNNs jointly as feature extractors improves image clustering; 2. using an end-to-end approach improves MVC; and 3. combining both produces state-of-the-art results for the problem of image clustering.

연구 동기 및 목표

  • 단일 사전 훈련된 CNN을 선택하는 데 있어 임의성으로 인해 성능에 심각한 영향을 미치는 문제를 해결하기 위해.
  • 다수의 사전 훈련된 CNN에서 유용한 보완 정보가 클러스터링 성능 향상에 기여할 수 있는지 탐색하기 위해.
  • 클러스터링과 특징 학습을 동시에 최적화하는 종단 간 딥 다중 시각 클러스터링 프레임워크를 개발하기 위해.
  • 다양한 CNN을 다중 시각 데이터로 간주함으로써 특징 추출기 선택에 대한 수동 설계 선택 사항을 제거하기 위해.
  • 사전 훈련된 특징을 사용한 다중 시각 클러스터링을 통해 이미지 클러스터링의 새로운 기준을 설정하기 위해.

제안 방법

  • 다양한 사전 훈련된 CNN에서 특징을 추출하여 동일한 데이터의 서로 다른 시각으로 간주함으로써 이미지 클러스터링 문제를 다중 시각 클러스터링(MVC) 문제로 재정의한다.
  • 다양한 CNN의 특징을 병렬로 처리하고 공통의 통합 표현을 학습하는 다중 입력 신경망 아키텍처(MVnet)를 제안한다.
  • 클러스터링 할당과 특징 표현을 동시에 최적화하기 위해 JULE 딥 클러스터링 프레임워크를 사용해 전체 파이프라인을 종단 간으로 훈련한다.
  • 클러스터링 손실과 재구성 손실을 조합한 공동 손실 함수를 사용하여 다수의 시각 간 통합 표현을 개선한다.
  • 중간 단계의 표현에 대해 t-SNE 시각화와 KMeans 클러스터링을 적용하여 각 단계에서의 특징 밀도와 분리도를 분석한다.
  • 세 가지 벤치마크 데이터셋(VOC2007, COIL100, UMist)에서 최신 기준 클러스터링 베이스라인과 비교하여 방법을 평가한다.

실험 결과

연구 질문

  • RQ1단일 CNN을 사용하는 것과 비교해 다수의 사전 훈련된 CNN에서 추출한 특징을 조합함으로써 이미지 클러스터링 성능 향상이 가능한가?
  • RQ2다중 시각 클러스터링 네트워크의 종단 간 훈련이 단계별 최적화보다 더 나은 클러스터링 결과를 도출하는가?
  • RQ3제안된 종단 간 프레임워크가 학습한 표현은 개별 CNN이나 고정된 특징 추출기의 표현보다 더 밀도가 높고 잘 분리되어 있는가?
  • RQ4제안된 방법이 비지도 이미지 클러스터링에서 단일 CNN 아키텍처 선택의 임의성을 제거할 수 있는가?
  • RQ5동일한 ImageNet 데이터셋에서 훈련된 서로 다른 사전 훈련된 CNN이 보완적인 정보를 제공하는가?

주요 결과

  • 제안된 방법, 즉 다수의 사전 훈련된 CNN과 종단 간 다중 시각 클러스터링(DMVC)을 조합한 방법은 VOC2007, COIL100, UMist 데이터셋에서 최신 기준 성능을 달성한다.
  • 다양한 CNN을 시각으로 사용함으로써 단일 CNN을 사용할 때보다 클러스터링 성능이 향상되며, UMist 데이터셋에서 NMI는 InceptionV3의 0.624에서 DMVC의 0.786으로 상승한다.
  • DMVC 프레임워크의 종단 간 훈련은 KMeans 클러스터링을 통해 중간 표현에 적용했을 때 더 밀도가 높고 잘 분리된 클러스터를 도출한다. UMist에서 NMI는 DMVC-fix의 0.759에서 0.973으로 상승한다.
  • t-SNE 시각화 결과는 최종 DMVC 표현이 개별 CNN의 표현이나 중간 단계의 표현보다 더 구분력 있고 잘 분리되어 있음을 확인한다.
  • 모든 세 데이터셋에서 JULE 및 기타 MVC 접근법과 같은 강력한 베이스라인을 초월하여 성능을 냄으로써 공동 다중 시각 학습의 효과성을 입증한다.
  • 제거 분석 결과, ResNet50만으로도 높은 성능(NMI = 0.997, VOC2007)을 달성하지만, 다른 네트워크와 조합함으로써도 성능 향상이 이루어지므로 아키텍처 간 보완 지식이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.