[論文レビュー] What is Where by Looking: Weakly-Supervised Open-World Phrase-Grounding without Text Inputs
本論文は、画像のみを入力として用い、学習時にテキストやボクセルボックスのアノテーションを一切使用しない、弱教師ありオープンワールドな純粋視覚的フレーズアライメント手法『What is Where by Looking』(WWbL)を提案する。CLIPを用いた画像・テキストマッチングとBLIPを用いた画像キャプション生成を組み合わせることで、弱教師あり局所化およびフレーズアライメントの分野で最先端の性能を達成し、人間が作成したキャプションを用いた完全教師ありベースラインと同等の結果を実現する。
Given an input image, and nothing else, our method returns the bounding boxes of objects in the image and phrases that describe the objects. This is achieved within an open world paradigm, in which the objects in the input image may not have been encountered during the training of the localization mechanism. Moreover, training takes place in a weakly supervised setting, where no bounding boxes are provided. To achieve this, our method combines two pre-trained networks: the CLIP image-to-text matching score and the BLIP image captioning tool. Training takes place on COCO images and their captions and is based on CLIP. Then, during inference, BLIP is used to generate a hypothesis regarding various regions of the current image. Our work generalizes weakly supervised segmentation and phrase grounding and is shown empirically to outperform the state of the art in both domains. It also shows very convincing results in the novel task of weakly-supervised open-world purely visual phrase-grounding presented in our work. For example, on the datasets used for benchmarking phrase-grounding, our method results in a very modest degradation in comparison to methods that employ human captions as an additional input. Our code is available at https://github.com/talshaharabany/what-is-where-by-looking and a live demo can be found at https://replicate.com/talshaharabany/what-is-where-by-looking.
研究の動機と目的
- 学習時にテキストやボクセルボックスのアノテーションを一切使用しない、弱教師あり、オープンワールドな純粋視覚的フレーズアライメントという新規タスクに取り組むこと。
- トレーニング語彙に含まれないオブジェクトが存在する可能性があるオープンワールド環境において、オブジェクト検出と記述を可能にすること。
- 人間が作成したキャプションを入力として必要としない、フレーズアライメントにおける競争力のある性能を達成すること。
- 事前学習済みの視覚言語モデルを用いることで、弱教師あり局所化がオープンワールドの視覚的フレーズアライメントに効果的に一般化できることを示すこと。
提案手法
- ボクセルボックスやセグメンテーションマスクを一切使用せず、COCOの画像キャプションのみを用いてセグメンテーションネットワーク $g$ を学習させることで、弱教師ありのアプローチを実現する。
- 前景領域と対応するキャプションを一致させるために、CLIPの画像・テキストマッチングスコアを監督信号として用いる。
- 4つの損失項を用いる:前景一致損失 ($L_{\text{fore}}$)、バックグラウンド拒否損失 ($L_{\text{back}}$)、CLIPの関連性マップガイド損失 ($L_{\text{rmap}}$)、マスク正則化損失 ($L_{\text{reg}}$)。
- 推論時、選択的探索を用いてオブジェクト候補を生成し、その後BLIPを用いて各領域の候補フレーズを生成する。
- CLIPの埋め込み空間で生成されたフレーズをクラスタリングし、重複を回避し、最も代表的なフレーズを選択する。
- 訓練済みのネットワーク $g$ を用い、全画像とフレーズを入力として、各フレーズの前景マスクを予測する。
実験結果
リサーチクエスチョン
- RQ1推論時にもテキスト入力が一切ない弱教師あり手法が、フレーズアライメントで最先端の性能を達成できるか?
- RQ2画像レベルの監督のみを用いて、トレーニング語彙外のオブジェクトカテゴリに一般化できるオープンワールドオブジェクト検出システムは実現可能か?
- RQ3CLIPのマッチングスコアとBLIPのキャプション生成能力を統合することで、純粋視覚的フレーズアライメントにどの程度効果的か?
- RQ4CLIPの説明可能性マップを用いることで、局所化性能がどの程度向上するか?
- RQ5COCOのキャプションで学習した弱教師あり局所化モデルは、未学習の画像に対してゼロショットフレーズアライメントに一般化できるか?
主な発見
- 提案手法は、MS-COCOでは61.03%、Visual Genomeでは65.95%の平均mAPを達成し、人間が作成したキャプションを用いた完全教師ありベースラインと同等の性能を示した。
- アブレーションスタディの結果、$L_{\text{rmap}}$ 損失項を除去すると性能が9%以上低下し、局所化精度の観点で極めて重要であることが示された。
- 最適な正則化係数 $\lambda_3 = 4$ を用いることで、CUBでは96.50%の精度を達成し、広い範囲の値において安定した性能を示した。
- MS-COCOおよびVisual Genomeのベンチマークにおいて、最先端の弱教師あり局所化およびフレーズアライメントモデルを上回る性能を示した。
- BLIPによるフレーズ生成とCLIPによるマッチングの統合により、冗長性のないフレーズクラスタリングが可能となり、フレーズアライメントの品質が向上した。
- ウェブ画像やBBCの「Week in Pictures」のような実世界のデータセットに対しても、良好なゼロショット一般化性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。