Skip to main content
QUICK REVIEW

[論文レビュー] Scaling up Multi-domain Semantic Segmentation with Sentence Embeddings

Wei Yin, Yifan Liu|arXiv (Cornell University)|Feb 4, 2022
Domain Adaptation and Few-Shot Learning被引用数 7
ひとこと要約

本論文は、Wikipediaから取得した記述文の埋め込み表現を用いてクラスラベルを置き換えるゼロショットセマンティックセグメンテーション手法を提案する。これにより、手動でのラベル整合化を伴わずに、複数ドメインのデータセットを自動的に統合できる。9つの多様なデータセットから200万枚以上の画像を用いて、異種損失を活用して訓練することで、ゼロショットおよびファインチューニング設定の7つのベンチマークデータセットで最先端の性能を達成した。PASCAL-Contextでは65%のmIoU、COCOのインスタンスセグメンテーションでは45.5%のAPを達成した。

ABSTRACT

We propose an approach to semantic segmentation that achieves state-of-the-art supervised performance when applied in a zero-shot setting. It thus achieves results equivalent to those of the supervised methods, on each of the major semantic segmentation datasets, without training on those datasets. This is achieved by replacing each class label with a vector-valued embedding of a short paragraph that describes the class. The generality and simplicity of this approach enables merging multiple datasets from different domains, each with varying class labels and semantics. The resulting merged semantic segmentation dataset of over 2 Million images enables training a model that achieves performance equal to that of state-of-the-art supervised methods on 7 benchmark datasets, despite not using any images therefrom. By fine-tuning the model on standard semantic segmentation datasets, we also achieve a significant improvement over the state-of-the-art supervised segmentation on NYUD-V2 and PASCAL-context at 60% and 65% mIoU, respectively. Based on the closeness of language embeddings, our method can even segment unseen labels. Extensive experiments demonstrate strong generalization to unseen image domains and unseen labels, and that the method enables impressive performance improvements in downstream applications, including depth estimation and instance segmentation.

研究の動機と目的

  • 固定されたクラスセットを持つ単一ドメインデータセットで学習された教師ありセマンティックセグメンテーションモデルの限界を克服すること。
  • 再訓練や手動アノテーションを伴わずに、未学習のクラスや画像ドメインに対してもゼロショット一般化を可能にすること。
  • 矛盾するラベル分類体系を持つ異種のセマンティックセグメンテーションデータセットを自動的に統合すること。
  • 疑似ラベルデータを活用して、深度推定やインスタンスセグメンテーションなどの下流タスクの性能を向上させること。
  • 言語ベースのラベル埋め込みが、従来のクラスラベルのスケーラブルで汎用的な代替手段として機能することを示すこと。

提案手法

  • 各クラスラベルをWikipediaから取得した記述文の高次元ベクトル埋め込みに置き換える。
  • CLIPのテキストエンコーダーを用いて文書埋め込みを生成し、埋め込み生成時に画像モalityを避ける。
  • 9つの多様なデータセットを統合したデータセット上で、一貫性のある意味的ラベルを有する200万枚以上の画像を活用してセグメンテーションモデルを訓練する。
  • 弱教師ありデータセット(例:Objects365、OpenImages)やノイズの多いアノテーションを効果的に活用するため、異種損失関数を導入する。
  • 新しいクラスの記述文の埋め込みを計算し、モデルの埋め込み空間にマッチングすることで、ゼロショット推論を可能にする。
  • 推論または訓練時に特徴マップに言語埋め込みを組み込むことで、学習済み表現を下流タスクに転移する。

実験結果

リサーチクエスチョン

  • RQ1文書埋め込みが従来のクラスラベルに置き換えることで、多様なドメインにまたがるゼロショットセマンティックセグメンテーションが可能になるか?
  • RQ2文書埋め込みを用いて複数のデータセットを統合することで、未学習のデータセットにおける一般化性能と性能が向上するか?
  • RQ3訓練データセットに存在しない未学習のクラスに対してもモデルが一般化可能か?
  • RQ4提案された異種損失は、弱教師ありおよびノイズの多いデータセットの活用にどの程度効果的か?
  • RQ5この手法は、深度推定やインスタンスセグメンテーションなどの下流タスクの性能をどの程度向上できるか?

主な発見

  • NYUD-V2では完全教師ありファインチューニングで60%のmIoU、PASCAL-Contextでは65%のmIoUを達成し、以前のSOTAを上回った。
  • 7つのクロスドメインベンチマークデータセットにおいて、それらのデータセットからの訓練画像を一切使用せず、最先端のゼロショット性能を達成した。
  • 「アヒル」や「ハナグマ」のような以前に未学習のラベルに対してもゼロショットセグメンテーションが可能であり、定性的な例でもその有効性が示された。
  • Objects365から得た疑似ラベルを用いてCOCOでファインチューニングした場合、インスタンスセグメンテーション性能が約4%のAP向上を達成し、COCOデータの50%を使用した場合でさえ、ベースラインのCondInstを上回った。
  • 単眼深度推定では、文書埋め込みから導出された疑似セマンティックラベルを用いることで、9つのゼロショットデータセットで一貫した性能向上が見られた。
  • 文書埋め込みの類似度行列は、単語埋め込みよりも優れた意味的クラスタリングを示しており、意味的整合性の向上を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。