Skip to main content
QUICK REVIEW

[論文レビュー] Scaling Open-Vocabulary Image Segmentation with Image-Level Labels

Golnaz Ghiasi, Xiuye Gu|arXiv (Cornell University)|Dec 22, 2021
Multimodal Machine Learning Applications被引用数 10
ひとこと要約

OpenSegは、画像レベルのキャプションを用いて任意のテキストクエリをセグメンテーションできるスケーラブルなオープンボリューム画像セグメンテーションフレームワークを提案する。まずクラスに依存しないセグメンテーションマスクを予測し、その後、領域レベルの特徴量を介してキャプション内の語をこれらのマスクにアライメントさせる。弱い教師付きの大規模キャプションデータを活用することで、PASCAL VOCでLSegに対して19.9 mIoUの向上を達成する。

ABSTRACT

We design an open-vocabulary image segmentation model to organize an image into meaningful regions indicated by arbitrary texts. Recent works (CLIP and ALIGN), despite attaining impressive open-vocabulary classification accuracy with image-level caption labels, are unable to segment visual concepts with pixels. We argue that these models miss an important step of visual grouping, which organizes pixels into groups before learning visual-semantic alignments. We propose OpenSeg to address the above issue while still making use of scalable image-level supervision of captions. First, it learns to propose segmentation masks for possible organizations. Then it learns visual-semantic alignments by aligning each word in a caption to one or a few predicted masks. We find the mask representations are the key to support learning image segmentation from captions, making it possible to scale up the dataset and vocabulary sizes. OpenSeg significantly outperforms the recent open-vocabulary method of LSeg by +19.9 mIoU on PASCAL dataset, thanks to its scalability.

研究の動機と目的

  • 閉じたカテゴリに限定されない任意のテキストクエリに対する画像セグメンエーションを可能にすること。
  • CLIP や ALIGN のようなビジョン・ランゲージモデルが、単一画像特徴量表現に起因するピクセルレベルの局在化の欠如という制限を克服すること。
  • 高価なピクセルレベルのアノテーションではなく、弱い教師付きの画像レベルキャプションを用いて、訓練データと語彙サイズをスケーラブルに拡大すること。
  • 中間レベルの視覚的グルーピングの後に視覚的・意味的アライメントを学習することで、局在化精度を向上させること。
  • 言語を統一インターフェースとして用いて、データセット間でのゼロショット転送性能を可能にすること。

提案手法

  • モデルは、領域から画像へのクロスアテンションを用いて、クラスに依存しないセグメンテーションヘッドで候補となるセグメンテーションマスクの集合を予測する。
  • 各予測マスク内のピクセルから、マスクベースの特徴量プーリングを実行し、位置に敏感な領域特徴量を生成する。
  • 視覚的・意味的アライメントは、領域と語の埋め込みの対比損失を用いて、キャプション内の語を予測マスクにマッチングさせることで学習する。
  • この手法は、事前学習済みのCLIP/ALIGNテキストエンコーダーを活用し、視覚バックボーンを大規模なALIGNチェックポイントから初期化することで、より良い初期化を実現する。
  • 訓練中のノイズを低減するため、キャプションに対してテキストフィルタリングを実施し、名詞と形容詞のみを保持する。
  • 推論時、予測マスクをプロポーザルとして用い、特徴マップと語の埋め込みのドット積を介してピクセル単位のセグメンテーションをガイドする。

実験結果

リサーチクエスチョン

  • RQ1ピクセルレベルのアノテーションではなく、画像レベルのキャプションから、オープンボリュームセグメンテーションのための視覚的・意味的アライメントを効果的に学習できるか?
  • RQ2マスクプロポーザルを介して中間レベルの視覚的グルーピングの後に視覚的・意味的アライメントを学習することで、グローバル画像特徴量上でエンドツーエンドのアライメントと比較して、局在化精度が向上するか?
  • RQ3画像キャプションによる弱い教師付き学習のスケーラビリティが、データセット間でのパフォーマンスと一般化性能に与える影響は何か?
  • RQ4テキストフィルタリング(例:名詞と形容詞のみを保持)が、モデルの頑健性とパフォーマンスに与える影響は何か?
  • RQ5大規模な弱い教師付きデータで学習したモデルは、保留されたセグメンテーションベンチマークで強力なゼロショット転送性能を達成できるか?

主な発見

  • OpenSegは、PASCAL VOCデータセットで最も強力なLSegモデルよりも19.9 mIoUの向上を達成し、優れたゼロショット一般化性能を示した。
  • 事前学習済みのALIGN視覚エンコーダーを初期化に用いることで、ランダムまたはNoisyStudent初期化よりも高いパフォーマンスを達成したが、差は小さい。
  • マスクプロポーザルなしの推論では、PC-59でmIoUが10.0ポイント低下し、マスクプロポーザルが正確な局在化に不可欠であることが示された。
  • 正例マスクをプロポーザルとして用いることで、PC-59でのmIoUは49.3に上昇し、現在のマスク予測が最適でないことが示され、主なボトルネックであることが判明した。
  • キャプションを名詞と形容詞のみにフィルタリングすることで最高のパフォーマンスが得られ、全単語を用いる場合に比べてmIoUが最大1.1ポイント向上した。
  • モデルは保留されたデータセットに対しても良好に一般化し、言語を統一インターフェースとして用いた汎用セグメンテーションモデルの訓練の可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。