[論文レビュー] Weakly-supervised segmentation of referring expressions
本稿では、ピクセルレベルのアノテーションを一切用いずに画像レベルの参照表現からセグメンテーションマスクを学習するトランスフォーマーに基づく弱教師あり参照表現セグメンテーション手法TSEGを紹介する。複数ラベルのパッチ割り当て機構を用いてテキストを視覚的パッチにマッピングすることで、TSEGはPhraseCutおよびRefCOCOで優れた性能を達成し、Pascal VOCではゼロショット転移mIoUが48.5を記録し、オープンボリュームセグメンテーションへの有望なスケーラビリティを示している。
Visual grounding localizes regions (boxes or segments) in the image corresponding to given referring expressions. In this work we address image segmentation from referring expressions, a problem that has so far only been addressed in a fully-supervised setting. A fully-supervised setup, however, requires pixel-wise supervision and is hard to scale given the expense of manual annotation. We therefore introduce a new task of weakly-supervised image segmentation from referring expressions and propose Text grounded semantic SEGgmentation (TSEG) that learns segmentation masks directly from image-level referring expressions without pixel-level annotations. Our transformer-based method computes patch-text similarities and guides the classification objective during training with a new multi-label patch assignment mechanism. The resulting visual grounding model segments image regions corresponding to given natural language expressions. Our approach TSEG demonstrates promising results for weakly-supervised referring expression segmentation on the challenging PhraseCut and RefCOCO datasets. TSEG also shows competitive performance when evaluated in a zero-shot setting for semantic segmentation on Pascal VOC.
研究の動機と目的
- ピクセル単位のアノテーションが高コストであるため、完全に教師ありの参照表現セグメンテーションにおけるスケーラビリティのボトルネックを解消すること。
- 画像レベルの参照表現のみを監視として用いる、弱教師ありの参照表現セグメンテーションの新しいタスクを導入すること。
- 画像レベルのラベルが不完全で語彙が事前に定義されていないオープンボリューム、構成的参照表現における弱教師ありセグメンテーションの課題を克服すること。
- ターゲットデータセット上で微調整なしにゼロショットセマンティックセグメンテーションに一般化できる手法を設計すること。
提案手法
- 参照表現セグメンテーションに適応したトランスフォーマー基盤のアーキテクチャとして、Segmenterを拡張したテキストに接地されたセマンティックSEGメントATION(TSEG)を提案する。
- パッチ-テキスト類似度を計算し、複数のテキストラベルを画像パッチに割り当てる、グローバルな重み付きプーリング機構であるマルチラベルパッチ割り当て(MPA)を導入する。
- トレーニング中にパッチ-テキスト類似度スコアを分類目的のガイドとして用い、画像レベルの監視からのエンドツーエンド学習を可能にする。
- 視覚トランスフォーマーのバックボーンを用いてパッチレベルの特徴を抽出し、テキストエンコーダーを用いて参照表現を処理する。
- MPA最適化済みのパッチ特徴を用いて、各参照表現ごとにセグメンテーションマスクを予測するマルチラベル分類ヘッドを適用する。
- Pascal VOCのクラス名をテキストプロンプトとしてエンコードし、信頼度スコアのしきい値を用いて予測マスクを選択することで、ゼロショット転移を実現する。
実験結果
リサーチクエスチョン
- RQ1視覚言語モデルは、ピクセルレベルの監視を一切用いずに、画像レベルの参照表現からのみ正確なセグメンテーションマスクを学習できるか?
- RQ2弱教師あり設定において、グローバルな最大プーリングや平均プーリングと比較して、提案されたマルチラベルパッチ割り当て機構は、セグメンテーション精度をどのように向上させるか?
- RQ3弱教師ありの参照表現で事前学習したモデルは、Pascal VOCのようなオープンボリュームデータセットにおけるゼロショットセマンティックセグメンテーションにどの程度一般化できるか?
- RQ4『より濃い茶色のテディベア』のような曖昧または細分化された記述に対して、弱教師ありの参照表現セグメンテーションにはどのような限界があるか?
- RQ5ラベル工学的アプローチ(例:『person』の代わりに『rider』や『woman』を使用)は、ゼロショット転移における『person』クラスのような未代表的クラスの性能低下を緩和できるか?
主な発見
- TSEGは、ピクセルレベルのアノテーションを一切使用せず、画像レベルの参照表現のみでPhraseCutテストセットで44.8 mIoUを達成し、GAP、GMP、SPAなどのベースラインを顕著に上回った。
- RefCOCOでは弱教師ありの設定で66.00 mIoUを達成し、このスプリットで最高の完全教師あり手法VLTを上回った。
- 完全教師あり設定では、PhraseCutで49.6 mIoUを達成し、より大きなデータセットで事前学習され、高解像度画像を用いたMDETRの53.1 mIoUに近く、非常に高い性能を示した。
- Pascal VOC 2012におけるゼロショット評価では、TSEGが48.5 mIoUを達成し、SPAベースライン(43.5 mIoU)を上回り、未観測クラスへの強力な一般化を示した。
- ラベル工学的処理(例:『person』の代わりに『rider』や『woman』を使用)を適用することで、TSEGのゼロショットmIoUは50.3に向上し、3000万枚の画像-テキストペアで学習されたGroupViTの51.2 mIoUに近づいた。
- 『person』クラスにおける失敗事例は、より具体的なテキストプロンプトの必要性を示しており、モデルバイアスが訓練データのアノテーションパターンに起因する部分があると示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。