Skip to main content
QUICK REVIEW

[논문 리뷰] Vision Transformer for Contrastive Clustering

Hua-Bao Ling, Bowen Zhu|arXiv (Cornell University)|2022. 06. 26.
Domain Adaptation and Few-Shot Learning인용 수 6
한 줄 요약

이 논문은 비전 트랜스포머(ViT)와 대비 학습을 융합한 새로운 비지도 딥 클러스터링 방법인 비전 트랜스포머를 통한 대비 클러스터링(VTCC)을 제안한다. ViT 인코더에 컨volutional 스템을 적용해 안정적인 패치 임베딩을 구현하고, 인스턴스 수준과 클러스터 수준의 두 가지 대비 프로젝터를 사용함으로써, 여덟 개의 데이터셋에서 최신 기술 수준의 성능을 달성하며, 훈련에서부터의 안정성과 클러스터링 정확도 향상을 입증한다.

ABSTRACT

Vision Transformer (ViT) has shown its advantages over the convolutional neural network (CNN) with its ability to capture global long-range dependencies for visual representation learning. Besides ViT, contrastive learning is another popular research topic recently. While previous contrastive learning works are mostly based on CNNs, some recent studies have attempted to combine ViT and contrastive learning for enhanced self-supervised learning. Despite the considerable progress, these combinations of ViT and contrastive learning mostly focus on the instance-level contrastiveness, which often overlook the global contrastiveness and also lack the ability to directly learn the clustering result (e.g., for images). In view of this, this paper presents a novel deep clustering approach termed Vision Transformer for Contrastive Clustering (VTCC), which for the first time, to our knowledge, unifies the Transformer and the contrastive learning for the image clustering task. Specifically, with two random augmentations performed on each image, we utilize a ViT encoder with two weight-sharing views as the backbone. To remedy the potential instability of the ViT, we incorporate a convolutional stem to split each augmented sample into a sequence of patches, which uses multiple stacked small convolutions instead of a big convolution in the patch projection layer. By learning the feature representations for the sequences of patches via the backbone, an instance projector and a cluster projector are further utilized to perform the instance-level contrastive learning and the global clustering structure learning, respectively. Experiments on eight image datasets demonstrate the stability (during the training-from-scratch) and the superiority (in clustering performance) of our VTCC approach over the state-of-the-art.

연구 동기 및 목표

  • 비전 트랜스포머(ViT)와 대비 학습을 융합하여 이미지 클러스터링에 적용할 때의 기술적 격차, 특히 전반적인 구조 모델링의 측면에서의 격차를 해소하기 위해.
  • 패치 추출을 위한 컨볼루션 스템을 도입하여 비전 트랜스포머(ViT)의 비지도 대비 학습에서의 훈련 안정성을 향상시키기 위해.
  • 이중 대비 프로젝터를 통해 인스턴스 수준과 클러스터 수준의 표현을 동시에 학습시켜 더 나은 클러스터링 구조 학습을 달성하기 위해.
  • 비지도 이미지 클러스터링에서 비전 트랜스포머 기반의 대비 클러스터링이 컨volution 네트워크 기반 방법보다 우월한 성능을 보임을 입증하기 위해.
  • 대비 목표를 갖춘 비전 트랜스포머 아키텍처를 사용하여 비지도 이미지 클러스터링의 새로운 벤치마크를 제공하기 위해.

제안 방법

  • 두 개의 증강된 이미지 뷰를 처리하기 위해 가중치 공유 뷰를 갖춘 비전 트랜스포머(ViT) 인코더를 백본으로 사용한다.
  • 표준 패치피이어(operation)를 대체하기 위해 스택된 작은 컨볼루션을 사용하는 컨볼루션 스템을 도입하여 훈련 안정성과 표현 품질을 향상시킨다.
  • 증강된 뷰 간의 대비 학습을 수행하여 인스턴스 수준 표현을 학습하는 인스턴스 프로젝터를 구현한다.
  • 클러스터 수준의 할당 기반으로 대비 학습을 수행하여 전반적인 클러스터링 구조를 학습하는 클러스터 프로젝터를 설계한다.
  • 인스턴스 수준과 클러스터 수준의 InfoNCE 손실을 조합한 복합 대비 손실을 사용하여 모델을 엔드 투 엔드로 훈련시킨다.
  • 훈련 후 최종 특징에 대해 K-means 클러스터링을 적용하여 평가한다.
Figure 1: Vision Transformer for Contrastive Clustering (VTCC) .
Figure 1: Vision Transformer for Contrastive Clustering (VTCC) .

실험 결과

연구 질문

  • RQ1비전 트랜스포머가 대비 학습과 효과적으로 융합되어 비지도 이미지 클러스터링 성능을 향상시킬 수 있는가?
  • RQ2컨볼루션 스템의 사용이 비지도 대비 클러스터링에서 비전 트랜스포머의 훈련 안정성과 성능 향상에 기여하는가?
  • RQ3인스턴스 수준과 클러스터 수준의 대비 학습 구성 요소가 최종 클러스터링 성능에 어떤 기여를 하는가?
  • RQ4제안된 VTCC 방법이 다양한 이미지 데이터셋에서 최신 기술 수준의 딥 클러스터링 접근법보다 뛰어난가?
  • RQ5전반적인 상호의존성(비전 트랜스포머를 통해)과 대비 학습을 동시에 모델링할 경우, 개별적으로 사용할 때보다 더 나은 클러스터링 성능을 달성하는가?

주요 결과

  • VTCC는 여덟 개의 실세계 이미지 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, RSOD 데이터셋에서 최고의 NMI 0.611을 기록하였다.
  • 컨볼루션 스템의 도입으로 클러스터링 성능이 향상되었으며, RSOD 데이터셋에서는 NMI가 0.570에서 0.611로, Chaoyang 데이터셋에서는 0.365에서 0.373으로 상승하였다.
  • 인스턴스 및 클러스터 프로젝터를 모두 사용할 경우 최고의 클러스터링 성능를 기록하였으며, RSOD에서는 NMI 0.611, Chaoyang에서는 0.373를 기록하여 단일 프로젝터 기반 베이스라인을 능가하였다.
  • ViT-Small 아키텍처가 성능와 효율성의 최적 균형을 이루었으며, 과적합이 줄어들어 소규모 데이터셋에서 ViT-Base를 능가하였다.
  • t-SNE 시각화 결과, 훈련 에포크가 진행될수록 특징 간 분리가 점진적으로 향상되었으며, RSOD 데이터셋에서 NMI는 0 에포크 시 0.231에서 500 에포크 시 0.611로 상승하였다.
  • 모델은 훈련에서부터의 강력한 안정성을 보이며, 비지도 이미지 클러스터링 응용에 실용적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.