[論文レビュー] Uncovering Prototypical Knowledge for Weakly Open-Vocabulary Semantic Segmentation
本稿では、ビジョントランスフォーマーにおけるグループトークンを明示的に監督するための非学習的プロトタイプ正則化(NPR)を導入する、弱いオープンボリューム言語的セマンティックセグメンテーションのための新規フレームワークPGSegを提案する。画像およびテキスト特徴量にガウス・ミックスチャネル・モデル(GMM)を適用して固定されたプロトタイプを生成することで、PGSegはグループトークンのコンパクト性と豊かさを向上させ、トレーニングと推論における粒度の不一致を解消し、より優れたセグメンテーション品質と耐性を達成する。これは、最先端の性能を達成する。
This paper studies the problem of weakly open-vocabulary semantic segmentation (WOVSS), which learns to segment objects of arbitrary classes using mere image-text pairs. Existing works turn to enhance the vanilla vision transformer by introducing explicit grouping recognition, i.e., employing several group tokens/centroids to cluster the image tokens and perform the group-text alignment. Nevertheless, these methods suffer from a granularity inconsistency regarding the usage of group tokens, which are aligned in the all-to-one v.s. one-to-one manners during the training and inference phases, respectively. We argue that this discrepancy arises from the lack of elaborate supervision for each group token. To bridge this granularity gap, this paper explores explicit supervision for the group tokens from the prototypical knowledge. To this end, this paper proposes the non-learnable prototypical regularization (NPR) where non-learnable prototypes are estimated from source features to serve as supervision and enable contrastive matching of the group tokens. This regularization encourages the group tokens to segment objects with less redundancy and capture more comprehensive semantic regions, leading to increased compactness and richness. Based on NPR, we propose the prototypical guidance segmentation network (PGSeg) that incorporates multi-modal regularization by leveraging prototypical sources from both images and texts at different levels, progressively enhancing the segmentation capability with diverse prototypical patterns. Experimental results show that our proposed method achieves state-of-the-art performance on several benchmark datasets. The source code is available at https://github.com/Ferenas/PGSeg.
研究の動機と目的
- 弱いオープンボリューム言語的セマンティックセグメンテーション(WOVSS)における粒度の不一致を解消すること。これは、グループトークンがすべての入力に対して1対1のアライメントでトレーニングされるが、推論時には1対1のアライメントで実行されるという問題である。
- 明示的な監視を導入することで、グループトークンの質を向上させ、コンパクト性と豊かさを強化すること。
- 外部監視としてのプロトタイプ知識を導入することで、弱い教師付きトレーニングとゼロショット推論のギャップを埋めること。
- 画像レベルおよびテキストレベルのマルチモーダルプロトタイプを活用し、多様な意味的パターンでグループトークン表現を豊かにすること。
- 限られた監視情報に依存せず、ピクセル単位のアノテーションに依存しない、実用的で効率的なセグメンテーションフレームワークを構築すること。
提案手法
- 非学習的プロトタイプ正則化(NPR)を提案。これは、ソース特徴量にガウス・ミックスチャネル・モデル(GMM)を適用し、固定で学習しないプロトタイプを生成することで、グループトークンの監視を実現する。
- グループトークンとGMMから導出されたプロトタイプとの対照的マッチングを適用し、特徴学習を正則化することで、コンパクト性と豊かさの両方を向上させる。
- 2つの変種を導入:画像レベルNPR(I-NPR)は低レベルの視覚的特徴量を、テキストレベルNPR(T-NPR)はCLIPでエンコードされたテキスト特徴量を用いて、マルチモーダルな監視を提供する。
- 段階的なトレーニング戦略を設計し、I-NPRとT-NPRを統合することで、抽象化の異なる段階でグループトークンを精錬する。
- 学習可能なグループトークンを備えたビジョントランスフォーマーのバックボーンを採用し、特徴クラスタリングの段階で正則化を適用することで、セグメンテーションの正確性を向上させる。
- グループトークンとプロトタイプを一致させる対照的損失を用いることで、各グループトークンが一貫性があり、ノイズが低減され、意味的に豊かな領域を表現するように学習させることを保証する。
実験結果
リサーチクエスチョン
- RQ1弱いオープンボリューム言語的セマンティックセグメンテーションにおけるグループトークンに、明示的な監視をどのように提供すれば、トレーニングと推論における粒度の不一致を解消できるか?
- RQ2どのようなプロトタイプ知識が、特徴表現におけるコンパクト性と豊かさを両立させるために効果的にグループトークンをガイドするか?
- RQ3画像とテキストの両方から導出されるマルチモーダルプロトタイプは、ゼロショットセグメンテーションにおけるグループトークンの汎化性と耐性を向上させることができるか?
- RQ4非学習的プロトタイプ正則化は、エンドツーエンドで学習されるクラスタリング手法に比べて、弱い教師付き設定でどれほど優れているか?
- RQ5画像レベルおよびテキストレベルのプロトタイプの統合は、全体のセグメンテーション性能および特徴の多様性にどのような影響を及ぼすか?
主な発見
- PGSegは、複数のベンチマークデータセットで最先端の性能を達成し、既存のWOVSS手法と比較して優れたセグメンテーション品質を示している。
- 提案されたNPRは、可視化と特徴分散分析により、グループトークンのコンパクト性を顕著に向上させ、特徴空間における冗長性とノイズを低減している。
- PGSegにおけるグループトークン特徴の次元分散は、GroupViTと比較して顕著に高いことが判明しており、より優れた表現多様性と次元の崩壊の低減を示している。
- 計算コストは妥当な水準を維持しており、13.6G FLOPsおよび35.1Mパラメータを有する。これはViT-S未満であり、GroupViTよりわずか3.2Gのみ高い。これは優れた効率性を示している。
- 可視化比較では、PGSegが限られたトレーニングデータにもかかわらず、クラスに依存しない形で物体全体を効果的に捉えており、傘や船といった直感的なカテゴリにおいても競争力のある結果を達成している。
- アブレーションスタディの結果、I-NPRとT-NPRの両方が肯定的な寄与を示しており、併用することで最良の性能が得られ、マルチモーダルプロトタイプ監視の利点が明確に示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。