[論文レビュー] ClusterFormer: Clustering As A Universal Visual Learner
ClusterFormerは、Transformerアーキテクチャ内での繰り返しクロスアテンションクラスタリングと特徴のディスpatchingを活用して、画像分類、物体検出、セグメンテーションを1つのクラスタリングベースのフレームワークで統合する汎用ビジョンモデルを提案する。複数のクラスタリング粒度レベルにおける説明可能で転移可能で階層的な表現学習を可能にすることで、ImageNet-1Kでは83.41%のトップ1精度、MS COCOの物体検出では54.2%のmAPを達成し、最先端の性能を実現した。
This paper presents CLUSTERFORMER, a universal vision model that is based on the CLUSTERing paradigm with TransFORMER. It comprises two novel designs: 1. recurrent cross-attention clustering, which reformulates the cross-attention mechanism in Transformer and enables recursive updates of cluster centers to facilitate strong representation learning; and 2. feature dispatching, which uses the updated cluster centers to redistribute image features through similarity-based metrics, resulting in a transparent pipeline. This elegant design streamlines an explainable and transferable workflow, capable of tackling heterogeneous vision tasks (i.e., image classification, object detection, and image segmentation) with varying levels of clustering granularity (i.e., image-, box-, and pixel-level). Empirical results demonstrate that CLUSTERFORMER outperforms various well-known specialized architectures, achieving 83.41% top-1 acc. over ImageNet-1K for image classification, 54.2% and 47.0% mAP over MS COCO for object detection and instance segmentation, 52.4% mIoU over ADE20K for semantic segmentation, and 55.8% PQ over COCO Panoptic for panoptic segmentation. For its efficacy, we hope our work can catalyze a paradigm shift in universal models in computer vision.
研究の動機と目的
- タスク固有のアーキテクチャ設計を必要とせず、多様な視覚タスクに一般化する汎用ビジョンモデルの開発。
- 視覚的理解を階層的クラスタリングプロセスとしてモデル化することで、人間の知覚的認知に類似した認識を実現すること。
- クラスタ中心の伝搬により、タスク間で転移可能で説明可能な表現学習を可能にすること。
- クラスタリング粒度(画像レベル、ボックスレベル、ピクセルレベル)を統合して、1つの整合的なフレームワークで画像分類、物体検出、セグメンテーションを統一すること。
- 従来の統合モデルの限界を克服するため、類似度に基づく透明な意思決定パイプラインを導入すること。
提案手法
- 中心次元に沿った特徴表現を用いて、繰り返し更新されるクラスタ中心を再定式化する「繰り返しクロスアテンションクラスタリング」を導入。
- 更新されたクラスタ中心との類似度に基づいて画像特徴を再配分する「特徴ディスpatchング」を採用し、透明で微分可能なパイプラインを実現。
- エンコーダのクラスタ中心をデコーダの初期クエリとして使用し、学習済み表現を下流タスクに直接転送可能にする。
- クラスタ割り当てと表現を精緻化するため、T=3の反復ステップを有するマルチステージで反復的なクラスタリング機構を適用。
- デコーダで学習可能なクエリ初期化戦略を採用し、エンコーダのクラスタ中心をタスク固有のクエリプロトタイプとして活用。
- 精度とパラメータ効率の両立を最適化した、デフォルトヘッド次元が32のマルチヘッドアテンション機構を採用。

実験結果
リサーチクエスチョン
- RQ1Transformerアーキテクチャ内でのクラスタリングベースのパラダイムが、一貫した性能で多様なビジョンタスクを統合できるか?
- RQ2クロスアテンションを用いた繰り返しクラスタ中心の精緻化が、タスク間での表現学習をどのように向上させるか?
- RQ3類似度に基づく特徴ディスpatchングが、モデルの透明性と性能をどの程度向上させるか?
- RQ4事前学習済みエンコーダのクラスタ中心が、検出やセグメンテーションなどの下流タスクのデコーダを効果的に初期化できるか?
- RQ5階層的クラスタリング粒度(画像レベル、ボックスレベル、ピクセルレベル)が、モデルの適応性と性能に与える影響はどの程度か?
主な発見
- ImageNet-1Kでは、スクラッチ学習時においてSwin Transformerを0.13–0.39%上回る83.41%のトップ1精度を達成。
- MS COCOの物体検出では、DINOとSwin Transformerを0.8–1.1%上回る54.2%のmAPを達成。
- インスタンスセグメンテーションでは、MS COCOで47.0%のmAPを達成し、Mask2FormerがSwin Transformerを上回る1.0–1.4%のmAPを達成。
- ADE20Kのセマンティックセグメンテーションでは、52.4%のmIoUを達成し、ベースラインモデルを0.6–1.3%上回る。
- COCOパンセグメンテーションでは、55.8%のPQを達成し、Mask2Formerを1.5–1.7%上回る。
- アブレーションスタディにより、繰り返しクロスアテンションクラスタリングがコサイン類似度に対して2.52%、バニラクロスアテンションに対して1.64%の精度向上を示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。