Skip to main content
QUICK REVIEW

[論文レビュー] What a MESS: Multi-Domain Evaluation of Zero-Shot Semantic Segmentation

Benedikt Blumenstiel, Johannes Jakubik|arXiv (Cornell University)|Jun 27, 2023
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、医療、地球観測、農業、工学分野から得た22の多様なデータセットを対象に、8つの最先端モデルを評価するマルチドメインゼロショットセマンティックセグメンテーションのベンチマーク「MESS」を紹介する。モデルの性能は、クラスの意味的類似性とセンサータイプに顕著に影響を受けることが明らかとなり、オラクルのバウンディングボックスを用いる場合、テキストからマスクを生成するモデルが、視覚言語モデルとSAMを組み合わせたモデルを上回ることが示された。

ABSTRACT

While semantic segmentation has seen tremendous improvements in the past, there are still significant labeling efforts necessary and the problem of limited generalization to classes that have not been present during training. To address this problem, zero-shot semantic segmentation makes use of large self-supervised vision-language models, allowing zero-shot transfer to unseen classes. In this work, we build a benchmark for Multi-domain Evaluation of Semantic Segmentation (MESS), which allows a holistic analysis of performance across a wide range of domain-specific datasets such as medicine, engineering, earth monitoring, biology, and agriculture. To do this, we reviewed 120 datasets, developed a taxonomy, and classified the datasets according to the developed taxonomy. We select a representative subset consisting of 22 datasets and propose it as the MESS benchmark. We evaluate eight recently published models on the proposed MESS benchmark and analyze characteristics for the performance of zero-shot transfer models. The toolkit is available at https://github.com/blumenstiel/MESS.

研究の動機と目的

  • ゼロショットセマンティックセグメンテーション分野において、多様なドメインにわたる包括的評価の不足に応えること、特にドメイン外一般化性能について。
  • ゼロショットモデル性能に顕著に影響を与えるタスクレベルの特徴、たとえばクラスの意味的類似性やセンサータイプといった要因を同定すること。
  • ドメイン内設定を超えたゼロショットセマンティックセグメンテーションモデルの評価を標準化するためのベンチマーク(MESS)を提供すること。
  • テキストからマスクを生成する、ポイントからマスクを生成する、ボックスからマスクを生成するアプローチを比較し、特にSAMやグランドイングモデルと組み合わせた場合の性能を検証すること。
  • 語彙選択やプロンプト工学の影響がセグメンテーション精度に与える影響を分析することで、今後のモデル設計を支援すること。

提案手法

  • 著者らは、ドメイン、センサータイプ、アノテーションスタイルに基づく分類に基づき、120のデータセットを収集・分類し、MESSベンチマークの代表的22データセットを選定した。
  • CAT-Seg-L、SAN-L、OVSeg-L、Grounded-SAMを含む8つの最近のゼロショットセマンティックセグメンテーションモデルを、MESSベンチマーク上で評価した。
  • 評価は、オープンボキャブラリーセマンティックセグメンテーション(OVSS)に焦点を当て、テキストからマスクを生成するモデルと、CLIPやSAMベースの視覚言語モデルのアプローチを比較した。
  • 研究では、mIoUなどの定量的指標に加え、医療画像、衛星画像、工学分野の分野における予測の定性的分析も含めた。
  • 局所化精度の影響を隔離するために、オラクル版のSAMが使用され、Grounding DINOから予測されたバウンディングボックスと真値のバウンディングボックスを比較した。
  • 著者らは、テキストプロンプト設計の影響を分析し、一般的なラベルとドメイン特化型のクラスラベルを比較してセグメンテーション性能に与える影響を検証した。
Figure 2: mIoU results for large models on a log scale. The datasets are grouped by their domain and sorted by supervised performance.
Figure 2: mIoU results for large models on a log scale. The datasets are grouped by their domain and sorted by supervised performance.

実験結果

リサーチクエスチョン

  • RQ1医療、地球観測、農業など、多様で現実世界のドメインにおいて、ゼロショットセマンティックセグメンテーションモデルはどのように性能を発揮するか?
  • RQ2クラスの意味的類似性やセンサーモダリティといったタスクレベルの特徴が、モデル性能に最も顕著に影響を与えるか?
  • RQ3テキストプロンプトの選択(たとえば、一般的な用語 vs. ドメイン特化型用語)が、セグメンテーション精度にどのように影響を与えるか?
  • RQ4テキストからマスクを生成するモデルと、視覚言語モデルにSAMを組み合わせたアプローチの間で、ゼロショット一般化性能に差は生じるか?
  • RQ5正確なオブジェクト局所化(バウンディングボックスによる)が、ゼロショットセグメンテーション性能をどの程度向上させるか?

主な発見

  • CAT-Seg-Lのようなテキストからマスクを生成するモデルは、予測されたバウンディングボックスを用いるGrounded-SAMでさえも上回る性能を示した。
  • 真の局所化が可能なオラクル版SAMは、多くの教師ありセマンティックセグメンテーションモデルを上回る性能を示し、局所化精度の重要性を浮き彫りにした。
  • 自然な視覚スペクトルで学習されたモデルは、赤外線や可視光以外のセンサデータに対して顕著に劣化するため、センサータイプ間の一般化には大きな課題があることが示された。
  • クラス間の意味的類似性(たとえば、鳥類の種や医療器具)は性能に悪影響を及ぼし、モデルは類似したクラスをしばしば混同する。
  • 一般的なクラスラベル(「道具」といった用語)を用いることで、ドメイン特化型用語(「外科用器具」)を用いる場合よりも顕著に高いセグメンテーション性能が得られた。
  • MESSベンチマークは、ドメイン内データセットでは優れた性能を示すものの、医療画像や工学分野へのゼロショット一般化性能は依然として著しく低いことが明らかになった。
Figure 3: mIoU results of large models in relative comparison to the supervised mIoU on a log scale. 100 is equal to the supervised mIoU.
Figure 3: mIoU results of large models in relative comparison to the supervised mIoU on a log scale. 100 is equal to the supervised mIoU.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。