[論文レビュー] Self-Supervised Learning of Object Parts for Semantic Segmentation
この論文では、視覚変換器(ViT)の空間トークンを密なクラスタリングによってオブジェクト部品を学習する自己教師あり手法Leopartを提案する。ViTの注目メカニズムと新規の事前学習タスクを活用することで、Pascal VOC、COCO-Thing、COCO-Stuffベンチマークで最先端の性能を達成し、転移表現学習および完全に自己教師ありのセマンティックセグメンテーションにおいて、先行する自己教師ありおよび教師あり手法を上回った。
Progress in self-supervised learning has brought strong general image representation learning methods. Yet so far, it has mostly focused on image-level learning. In turn, tasks such as unsupervised image segmentation have not benefited from this trend as they require spatially-diverse representations. However, learning dense representations is challenging, as in the unsupervised context it is not clear how to guide the model to learn representations that correspond to various potential object categories. In this paper, we argue that self-supervised learning of object parts is a solution to this issue. Object parts are generalizable: they are a priori independent of an object definition, but can be grouped to form objects a posteriori. To this end, we leverage the recently proposed Vision Transformer's capability of attending to objects and combine it with a spatially dense clustering task for fine-tuning the spatial tokens. Our method surpasses the state-of-the-art on three semantic segmentation benchmarks by 17%-3%, showing that our representations are versatile under various object definitions. Finally, we extend this to fully unsupervised segmentation - which refrains completely from using label information even at test-time - and demonstrate that a simple method for automatically merging discovered object parts based on community detection yields substantial gains.
研究の動機と目的
- セマンティックセグメンテーションのための効果的で自己教師ありの高密度表現学習が、特に自己教師ありまたは弱教師ありの設定において不足しているという問題に取り組む。
- 事前に定義されたオブジェクト定義の脆さを克服し、後から再構成可能な汎用的なオブジェクト部品を学習することで、オブジェクトを再構成可能にする。
- 人為的アノテーションラベルに依存せずに、意味的に構造的で空間的に識別可能なトークン埋め込みを学習することで、ViTベースの自己教師ありモデルを改善する。
- クラスタ共起ネットワーク上のコミュニティ検出を用いて、学習されたオブジェクト部品を自動的に統合することで、完全に自己教師ありのセマンティックセグメンテーションパイプラインを実現する。
提案手法
- 画像パッチから空間トークンを抽出するために、DINO事前学習を施した視覚変換器(ViT)を活用する。
- 特徴の類似度に基づいて空間トークンをグループ化する密なクラスタリング事前学習タスクを導入し、モデルが意味的に意味のあるオブジェクト部品を学習するように促進する。
- モーメンタムエンコーダーを用いた対照的クラスタリングにより、トレーニングの安定性を高め、パッチ間での特徴の識別能を向上させる。
- クラスタの共起ネットワーク上でコミュニティ検出を適用し、完全に自己教師ありの設定でオブジェクト部品を自動的に統合して一貫性のあるオブジェクトセグメンテーションを形成する。
- 2段階の推論パイプラインを採用する:まず、注目マップとクラスタマスクを用いたクラスタベースのフォアグラウンド抽出(CBFE);次に、フォアグラウンドトークンに対してK-Meansによる過剰クラスタリング。
- ノードが学習されたクラスタを表し、エッジが空間的共起を表すクラスタ共起ネットワークを構築し、コミュニティ検出により上位レベルのオブジェクトに類似したセグメンテーションを形成する。

実験結果
リサーチクエスチョン
- RQ1密なクラスタリングによるオブジェクト部品の自己教師あり学習が、セマンティックセグメンテーションのためのViTベースの高密度表現の質を向上させることができるか?
- RQ2オブジェクト部品を汎用的な中間表現として学習することで、下流のセマンティックセグメンテーションタスクにおいて、直接の自己教師あり事前学習を上回ることができるか?
- RQ3人為的アノテーションラベルをテスト時において一切使用せず、学習されたオブジェクト部品とコミュニティ検出のみを用いて完全に自己教師ありのセグメンテーションパイプラインを構築できるか?
- RQ4提案手法は、さまざまなオブジェクト定義とデータセットにおいて、教師ありおよび半教師ありのベースラインと比較して、転送性および性能の点で優れているか?
主な発見
- LeopartはDINOの自己教師ありViTを9%向上させ、フォアグラウンド抽出におけるJaccard距離とBoundary F1スコアでそれぞれ9%向上させ、専用の自己教師ありサリエンシー推定手法を上回った。
- Pascal VOC、COCO-Thing、COCO-Stuffベンチマークにおいて、Leopartは最先端の性能を達成し、先行する自己教師ありおよび教師あり手法をmIoUで3%から17%上回った。
- CBFE(クラスタベースのフォアグラウンド抽出)とコミュニティ検出(CD)の組み合わせにより、完全に自己教師ありのセグメンテーション性能が、先行の自己教師あり手法よりも6%以上向上した。
- コミュニティ検出は、自転車のホイールと車のホイールを別々のクラスタとして識別し、人間の顔や髪の毛といった意味的に類似した部品を同じコミュニティにグループ化するなど、意味的に一貫性のあるオブジェクト部品を効果的に同定した。
- 本手法は、自己教師ありで学習されたオブジェクト部品が、異なる定義のもとで動的に再構成可能であることを示し、多様な粒度のベンチマークにおいてその柔軟性を実証した。
- ViTはオブジェクト局在化において強力であるが、提案された密なクラスタリング損失で微調整しない限り、セグメンテーションのための識別的な空間埋め込みを学習できないことが明らかになった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。