Skip to main content
QUICK REVIEW

[論文レビュー] A Simple Baseline for Open-Vocabulary Semantic Segmentation with Pre-trained Vision-language Model

Mengde Xu, Zheng Zhang|arXiv (Cornell University)|Dec 29, 2021
Multimodal Machine Learning Applications被引用数 12
ひとこと要約

本論文は、事前学習済みのビジョン・ランゲージモデル(CLIP)を用いたオープンボリュームセマンティックセグメンテーションのための単純な二段階フレームワークを提案する。まずクラスに依存しないマスク候補を生成し、次にそれらをCLIPでクロップされた画像パッチに対して分類することで、ゼロショット性能がSOTAに達する:Pascal VOC 2012で+29.5 hIoU、COCO Stuffで+8.9 hIoUを記録し、先行手法を大きく上回った。

ABSTRACT

Recently, open-vocabulary image classification by vision language pre-training has demonstrated incredible achievements, that the model can classify arbitrary categories without seeing additional annotated images of that category. However, it is still unclear how to make the open-vocabulary recognition work well on broader vision problems. This paper targets open-vocabulary semantic segmentation by building it on an off-the-shelf pre-trained vision-language model, i.e., CLIP. However, semantic segmentation and the CLIP model perform on different visual granularity, that semantic segmentation processes on pixels while CLIP performs on images. To remedy the discrepancy in processing granularity, we refuse the use of the prevalent one-stage FCN based framework, and advocate a two-stage semantic segmentation framework, with the first stage extracting generalizable mask proposals and the second stage leveraging an image based CLIP model to perform open-vocabulary classification on the masked image crops which are generated in the first stage. Our experimental results show that this two-stage framework can achieve superior performance than FCN when trained only on COCO Stuff dataset and evaluated on other datasets without fine-tuning. Moreover, this simple framework also surpasses previous state-of-the-arts of zero-shot semantic segmentation by a large margin: +29.5 hIoU on the Pascal VOC 2012 dataset, and +8.9 hIoU on the COCO Stuff dataset. With its simplicity and strong performance, we hope this framework to serve as a baseline to facilitate future research. The code are made publicly available at~\url{https://github.com/MendelXu/zsseg.baseline}.

研究の動機と目的

  • 画像レベルのビジョン・ランゲージモデル(例:CLIP)をピクセルレベルのセマンティックセグメンテーションタスクに適用する際のギャップを解消すること。
  • CLIPの画像レベルとピクセルレベルのセグメンテーションの間の粒度の不一致を解消するために、マスク生成と分類を分離すること。
  • 事前学習済みのCLIPと単純な二段階パイプラインのみを用いて、未学習カテゴリへの強力なゼロショット一般化を可能にすること。
  • 今後のオープンボリュームセマンティックセグメンテーション分野における研究のための単純だが効果的なベースラインを確立すること。

提案手法

  • 本手法は二段階フレームワークを採用する:まずマスクヘッド(例:MaskFormer)を用いてクラスに依存しないマスク候補を生成し、次にそれらをCLIPでクロップされた画像パッチに対して分類する。
  • 各マスク候補を用いて入力画像をクロップし、そのパッチを事前学習済みのCLIPモデルに投入してゼロショット分類を実行する。
  • 未学習カテゴリの分類精度を向上させるために、学習可能なプロンプトチューニング戦略を適用し、プロンプトは見逃しカテゴリのみで訓練される。
  • CLIPとピクセル単位分類の間の粒度の不一致が原因で性能が著しく低下するため、一括FCNアプローチを避ける。
  • クロップされたパッチ内のバックグラウンドピクセルは、学習可能な値やマスクトークンで埋めるが、これらの方法は不安定であり、単純なベースライン戦略に劣ることが示された。
  • マスク付きクロップ推論を通じて、CLIPの強力なビジョン・カテゴリ整合性を活用し、画像レベル認識とピクセルレベルセグメンテーションを一致させる。

実験結果

リサーチクエスチョン

  • RQ1視覚的粒度の不一致があるにもかかわらず、事前学習済みのビジョン・ランゲージモデル(例:CLIP)がオープンボリュームセマンティックセグメンテーションに効果的に適応可能か。
  • RQ2マスク候補生成と分類を分離する二段階フレームワークが、ゼロショットセグメンテーションにおいて一括FCNベースの手法を上回るか。
  • RQ3CLIPにおけるプロンプト学習が、セマンティックセグメンテーションにおける未学習カテゴリへのゼロショット一般化をどのように向上させるか。
  • RQ4マスクされた画像パッチにおける異なるバックグラウンド埋め方戦略が、セグメンテーション性能に与える影響は何か。
  • RQ5本手法は微調整なしで、特にクロスデータセット評価設定において、十分に一般化可能か。

主な発見

  • クロスデータセット評価において、本手法はCityscapesで+13.1 mIoU、Pascal Contextで+19.6 mIoU、ADE20k(150クラス)で+5.6 mIoU、ADE20k(847クラス)で+2.9 mIoUをFCNベースライン上回った。
  • Pascal VOC 2012では、自己学習を伴っても、先行SOTA手法を+29.5 hIoU上回った。
  • COCO Stuffでは、ゼロショット評価において先行SOTAを+8.9 hIoU上回り、未学習クラスへの強力な一般化を示した。
  • 学習可能なプロンプトチューニングは、手動で設計されたプロンプトに比べて+9.9 hIoUの性能向上をもたらし、見逃しカテゴリおよび学習済みカテゴリの両方で一貫した向上が得られた。
  • カテゴリあたり32サンプルを用いたプロンプト学習が最良の性能を示し、より多くのサンプルは結果を劣化させ、過学習のリスクがあることを示唆した。
  • ViT/B-16とCLIP事前学習を用いた場合、COCO Stuffで77.5 hIoUを達成し、ImageNet事前学習ベースラインを著しく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。