[論文レビュー] CLIP-DINOiser: Teaching CLIP a few DINO tricks for open-vocabulary semantic segmentation
CLIP-DINOiser は、CLIP の密な特徴を、DINO からの自己教師付き局在化事前知識を用いて、1回の CLIP フォワードパスで適用される2つの軽量畳み込み層によって精錬することで、ゼロショットオープンボリューム意味セグメンテーションを向上させる。本手法は、アノテーションや微調整なしに COCO、Pascal Context、Cityscapes、ADE20k で最先端の性能を達成する。
The popular CLIP model displays impressive zero-shot capabilities thanks to its seamless interaction with arbitrary text prompts. However, its lack of spatial awareness makes it unsuitable for dense computer vision tasks, e.g., semantic segmentation, without an additional fine-tuning step that often uses annotations and can potentially suppress its original open-vocabulary properties. Meanwhile, self-supervised representation methods have demonstrated good localization properties without human-made annotations nor explicit supervision. In this work, we take the best of both worlds and propose an open-vocabulary semantic segmentation method, which does not require any annotations. We propose to locally improve dense MaskCLIP features, which are computed with a simple modification of CLIP's last pooling layer, by integrating localization priors extracted from self-supervised features. By doing so, we greatly improve the performance of MaskCLIP and produce smooth outputs. Moreover, we show that the used self-supervised feature properties can directly be learnt from CLIP features. Our method CLIP-DINOiser needs only a single forward pass of CLIP and two light convolutional layers at inference, no extra supervision nor extra memory and reaches state-of-the-art results on challenging and fine-grained benchmarks such as COCO, Pascal Context, Cityscapes and ADE20k. The code to reproduce our results is available at https://github.com/wysoczanska/clip_dinoiser.
研究の動機と目的
- 人為的セグメンテーションデータを一切必要とせず、CLIP を用いたゼロショットオープンボリューム意味セグメンテーションを可能にすること。
- 元々ノイズが多く、細粒度の構造を欠いている CLIP の密な特徴の空間的局在化品質を向上させること。
- 微調整やクラス固有のプロトタイプ構築を避けることで、CLIP の元のオープンボリューム能力を維持すること。
- 1回の CLIP フォワードパスと2つの軽量畳み込み層のみを追加することで、最小限の計算コストで高い性能を達成すること。
- CLIP はもともと有用な局在化事前知識を内蔵しており、それを自己教師付きガイドにより抽出・強化できることを示すこと。
提案手法
- グローバル自己注意層を畳み込み層に変更することで、視覚言語アライメントを保持しつつ、密なピクセル単位の特徴を生成する MaskCLIP を変更する。
- DINO のピクセル相関パターンを模倣する学習可能な畳み込みプーリング層を導入し、CLIP 特徴から概念に敏感で局在化された特徴プーリングを生成する。
- アノテーションを一切必要とせず、自己教師付き DINO 特徴を蒸留ターゲットとして用いることで、プーリング重みの学習をガイドする。
- CLIP 特徴からオブジェクトネススコアを学習するための2番目の軽量畳み込み層を導入し、DINO の無教師オブジェクトネスマップ(FOUND)を模倣する。
- 学習されたプーリングマップとオブジェクトネスマップを用いて、1回の CLIP フォワードパスで高品質なセグメンテーションマスクを生成する。
- 二重パス機構を採用:1つは概念に敏感な局在化、もう1つは背景検出、両方とも DINO をガイドとして訓練する。
実験結果
リサーチクエスチョン
- RQ1微調整やアノテーションなしに、CLIP の密な特徴を効果的に精錬して局在化性能を向上させられるか?
- RQ2自己教師付き DINO 特徴は、CLIP がより整合性があり滑らかなセグメンテーションマスクを生成するのをどの程度効果的にガイドできるか?
- RQ3DINO からのオブジェクトネスとピクセル相関事前知識を、軽量な学習可能な層のみで CLIP 特徴に直接転送できるか?
- RQ4最小限の追加計算で済む1パス推論パイプラインは、複数パスまたはプロトタイプベースの手法を上回る性能を発揮するか?
- RQ5CLIP-DINOiser は、細粒度で複雑なベンチマークでも、オープンボリュームの柔軟性を維持しながら最先端の性能を達成できるか?
主な発見
- COCO、Pascal Context、Cityscapes、ADE20k でそれぞれ、2番目に良い手法より +6.7 mIoU、+5.1 mIoU、+5.0 mIoU、+2.2 mIoU の向上を達成し、最先端の性能を実現した。
- Pascal VOC では 60.1 mIoU を達成し、MaskCLIP より +6.4 mIoU の向上を示した。また、FOUND オブジェクトネスマップの不確実性に基づく精錬を適用すると、最大 62.1 mIoU に達した。
- OVDiff は各概念のプロトタイプ構築を必要としているが、本手法は Context で +2.3 mIoU、Object で +0.2 mIoU の向上を示した。
- 特に Cityscapes や ADE20k のような複雑なシーンにおいて、CLIP-DIY や TCL よりもより正確で細粒度の局在化を実現した。
- 本手法は完全なオープンボリューム能力を維持しており、CLIP の1回のフォワードパスで動作し、推論時には2つの追加軽量畳み込み層のみを追加する。
- アブレーションスタディにより、性能向上は概念に敏感なプーリングと学習されたオブジェクトネスマップの両方によるものであり、後者は背景セグメンテーションの向上に顕著に寄与していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。