[論文レビュー] Open-World Instance Segmentation: Exploiting Pseudo Ground Truth From Learned Pairwise Affinity
本論文は、未学習の画像から学習されたペairワイズ類似度予測子を用いて仮の正例マスクを生成することで、オープンワールドインスタンスセグメンテーションのための汎用的グルーピングネットワーク(GGNs)を提案する。実際のアノテーションとこれらの仮のマスクを組み合わせることで、COCO、LVIS、ADE20K、UVOのベンチマークにおいて、未学習のカテゴリに対して閉世界モデルを著しく上回り、ドメイン外データへの一般化性能も優れている。
Open-world instance segmentation is the task of grouping pixels into object instances without any pre-determined taxonomy. This is challenging, as state-of-the-art methods rely on explicit class semantics obtained from large labeled datasets, and out-of-domain evaluation performance drops significantly. Here we propose a novel approach for mask proposals, Generic Grouping Networks (GGNs), constructed without semantic supervision. Our approach combines a local measure of pixel affinity with instance-level mask supervision, producing a training regimen designed to make the model as generic as the data diversity allows. We introduce a method for predicting Pairwise Affinities (PA), a learned local relationship between pairs of pixels. PA generalizes very well to unseen categories. From PA we construct a large set of pseudo-ground-truth instance masks; combined with human-annotated instance masks we train GGNs and significantly outperform the SOTA on open-world instance segmentation on various benchmarks including COCO, LVIS, ADE20K, and UVO. Code is available on project website: https://sites.google.com/view/generic-grouping/.
研究の動機と目的
- オープンワールド設定において、既存のモデルが事前に定義されたクラス分類体系に依存するため、未学習のカテゴリにおけるインスタンスセグメンテーションの性能ギャップを是正すること。
- 意味的監視を必要とせず、多様で未学習のオブジェクトカテゴリに一般化可能なクラスに依存しないインスタンス提案手法を開発すること。
- 大規模な未ラベル付きデータ上で無教師のペアワイズ類似度学習から得られる仮の正例マスクを活用することで、モデルの一般化性能を向上させること。
- 未ラベル画像からの仮の正例マスクを事前学習に用いることで、ImageNetの監視よりもオープンワールド一般化に強いインダクティブバイアスが得られることを示すこと。
提案手法
- 非包括的なセグメンテーションマスクを監視として用い、局所的なピクセルレベルの関係を予測するペアワイズ類似度予測子(PA)を学習させ、未学習のカテゴリへの一般化を可能にする。
- PAモデルが生成する類似度マップをグループ化モジュールの入力として用い、カテゴリに依存しない高スコアのマスク提案を生成し、仮の正例マスクとして利用する。
- 実際のヒューマンアノテートマスクと生成された仮の正例マスクの両方を用いて、クラスに依存しないMask R-CNNをエンドツーエンドで微調整し、汎用的なインスタンス提案能力を向上させる。
- PAベースのグループ化により、大規模な未ラベルデータセット(例:ImageNet、OpenImages)で事前学習することでスケーリングを実現し、追加のデータ多様性を確保する。
- PAベースのグループ化からのオブジェクトネススコアと、OLN(オープンワールド学習ネットワーク)モジュールからの別のオブジェクトネススコアを組み合わせることで性能を向上させる。
- ADE20KおよびUVOでは微調整を行わず、すべてのマスクを正例として扱い、実世界のオープンワールド条件を模擬して評価する。
実験結果
リサーチクエスチョン
- RQ1意味的監視なしに、無教師の局所ピクセル関係を活用することで、オープンワールドインスタンスセグメンテーションで強力な性能を達成できるか?
- RQ2ペアワイズ類似度から得られる仮の正例マスク生成は、標準的な教師あり事前学習と比較して、未学習のカテゴリへの一般化を向上させるか?
- RQ3未ラベル画像からの仮の正例マスクを用いた事前学習は、オープンワールドとクローズドワールド設定の両方で性能にどのように影響を与えるか?
- RQ4PAベースのグループ化と既存のオープンワールドモデル(例:OLN)を組み合わせることで、最先端の性能がさらに向上するか?
主な発見
- ADE20KおよびUVOにおいて、GGNsはMask R-CNNおよびSelective Searchを著しく上回り、20個の正例オブジェクトのうち14個の真陽性提案を達成したのに対し、それぞれ5個および4個にとどまった。
- LVISベンチマークでは、仮の正例マスクを用いた事前学習により、前回の最先端(OLN)と比較して平均リCALL(AR@100)が6.8%向上し、新たな最先端性能を確立した。
- ImageNetの監視による事前学習と比較して、ImageNetからの仮の正例マスクを用いた事前学習は、オープンワールド性能を1.4%向上させたが、クローズドワールド設定ではわずかに性能が劣った。
- 1枚あたりの仮の正例マスクの数が増えること、および事前学習時に使用される未ラベルピクセルの数が多くなることで性能が向上し、ノイズに強くスケーラブルであることが示された。
- 実世界の設定でも良好な一般化性能を示した:ADE20KおよびUVOで微調整なしに評価したところ、見慣れないカテゴリを含め、両方のカテゴリでベースラインを上回るARおよびAPを達成した。
- PAベースのグループ化とOLNからのオブジェクトネススコアを組み合わせることで性能が向上し、提案スコアリングにおける相補的な強みが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。