Skip to main content
QUICK REVIEW

[論文レビュー] Vision Transformer for Contrastive Clustering

Hua-Bao Ling, Bowen Zhu|arXiv (Cornell University)|Jun 26, 2022
Domain Adaptation and Few-Shot Learning被引用数 6
ひとこと要約

本稿では、画像クラスタリングのための自己教師付き深層クラスタリング手法である、ビジョントランスフォーマーを用いた対照的クラスタリング(VTCC)を提案する。VTCCは、ビジョントランスフォーマー(ViT)と対照的学習を統合することで、学習から始める際の安定性とクラスタリング精度を向上させ、8つのデータセットで最先端の性能を達成した。

ABSTRACT

Vision Transformer (ViT) has shown its advantages over the convolutional neural network (CNN) with its ability to capture global long-range dependencies for visual representation learning. Besides ViT, contrastive learning is another popular research topic recently. While previous contrastive learning works are mostly based on CNNs, some recent studies have attempted to combine ViT and contrastive learning for enhanced self-supervised learning. Despite the considerable progress, these combinations of ViT and contrastive learning mostly focus on the instance-level contrastiveness, which often overlook the global contrastiveness and also lack the ability to directly learn the clustering result (e.g., for images). In view of this, this paper presents a novel deep clustering approach termed Vision Transformer for Contrastive Clustering (VTCC), which for the first time, to our knowledge, unifies the Transformer and the contrastive learning for the image clustering task. Specifically, with two random augmentations performed on each image, we utilize a ViT encoder with two weight-sharing views as the backbone. To remedy the potential instability of the ViT, we incorporate a convolutional stem to split each augmented sample into a sequence of patches, which uses multiple stacked small convolutions instead of a big convolution in the patch projection layer. By learning the feature representations for the sequences of patches via the backbone, an instance projector and a cluster projector are further utilized to perform the instance-level contrastive learning and the global clustering structure learning, respectively. Experiments on eight image datasets demonstrate the stability (during the training-from-scratch) and the superiority (in clustering performance) of our VTCC approach over the state-of-the-art.

研究の動機と目的

  • ビジョントランスフォーマー(ViT)と対照的学習を統合して画像クラスタリングに応用する際のギャップ、特にグローバル構造のモデリングを補うことを目的とする。
  • パッチ抽出のための畳み込みスタムを導入することで、自己教師付き対照的学習におけるViTの訓練安定性を向上させることを目的とする。
  • 二重の対照的プロジェクタ(インスタンスレベルおよびクラスタレベル)を用いて、インスタンスレベルとクラスタレベルの表現を同時に学習することで、より良いクラスタリング構造の学習を実現することを目的とする。
  • ViTベースの対照的クラスタリングが、畳み込みニューラルネットワーク(CNN)ベースの手法を上回ることを示すこと。
  • 対照的目的関数を用いたViTアーキテクチャを用いた自己教師付き画像クラスタリングのための新しいベンチマークを提供すること。

提案手法

  • 重み共有のビューを用いたビジョントランスフォーマー(ViT)エンコーダーをバックボーンとして用い、各画像の2つの拡張ビューを処理する。
  • 標準のパッチ化処理に代えて畳み込みスタムを採用し、スタックされた小さな畳み込み層を用いて訓練の安定性と表現品質を向上させる。
  • インスタンスプロジェクタは、拡張されたビュー間の対照的学習により、インスタンスレベルの表現を学習する。
  • クラスタープロジェクタは、クラスターレベルの割り当てに基づく対照的学習を実行し、グローバルなクラスタリング構造を学習する。
  • インスタンスレベルとクラスターレベルのInfoNCE損失を組み合わせた統合損失関数を用いて、エンドツーエンドでモデルを訓練する。
  • 訓練後、最終特徴量に対してK-meansクラスタリングを適用し、評価を実施する。
Figure 1: Vision Transformer for Contrastive Clustering (VTCC) .
Figure 1: Vision Transformer for Contrastive Clustering (VTCC) .

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーを対照的学習と効果的に統合することで、自己教師付き画像クラスタリングの性能を向上させることができるか?
  • RQ2畳み込みスタムの使用が、自己教師付き対照的クラスタリングにおけるViTの訓練安定性と性能に寄与するか?
  • RQ3インスタンスレベルおよびクラスターレベルの対照的学習コンponentが、最終的なクラスタリング性能にどのように寄与するか?
  • RQ4提案手法VTCCは、多様な画像データセットにおいて最先端の深層クラスタリング手法を上回る性能を示すか?
  • RQ5グローバル依存関係(ViTによる)と対照的学習を同時にモデリングすることで、単独で用いる場合よりも優れたクラスタリングが得られるか?

主な発見

  • VTCCは8つの実世界の画像データセットで最先端の性能を達成し、RSODデータセットでは最高のNMI 0.611を記録した。
  • 畳み込みスタムの導入によりクラスタリング性能が向上し、RSODデータセットではNMIが0.570から0.611に、Chaoyangデータセットでは0.365から0.373に上昇した。
  • インスタンスおよびクラスタープロジェクタの両方を用いることで最良のクラスタリング性能が得られ、RSODではNMI 0.611、Chaoyangでは0.373を記録し、単一プロジェクタベースラインを上回った。
  • ViT-Smallアーキテクチャが性能と効率のバランスが良く、過学習の低減により、小規模データセットではViT-Baseを上回った。
  • t-SNE可視化では、訓練エポックが進むにつれて特徴の分離が段階的に向上し、RSODデータセットではNMIが0エポックの0.231から500エポックの0.611に上昇した。
  • 学習から始める際の強い訓練安定性を示し、自己教師付き画像クラスタリングにおける実用性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。