[論文レビュー] Weakly Supervised Object Localization Using Things and Stuff Transfer
本稿では、境界ボックスアノテーションが存在しない対象データセット(ILSVRC、COCO、VOC 2007)へ、ソースデータセット(PASCAL Context)からセマンティックセグメンテーションの知識——インスタンス/ストラクチャラルマップ、クラス類似度、共起関係——を転送する弱教師付きオブジェクト検出手法であるThings and Stuff Transfer(TST)を提案する。転送された知識でセグメンテーションマップを精緻化し、それを複数インスタンス学習(MIL)フレームワークにフィードバックすることで、標準MILよりmAPを最大7.9%向上させ、最先端の性能を達成した。
We propose to help weakly supervised object localization for classes where location annotations are not available, by transferring things and stuff knowledge from a source set with available annotations. The source and target classes might share similar appearance (e.g. bear fur is similar to cat fur) or appear against similar background (e.g. horse and sheep appear against grass). To exploit this, we acquire three types of knowledge from the source set: a segmentation model trained on both thing and stuff classes; similarity relations between target and source classes; and co-occurrence relations between thing and stuff classes in the source. The segmentation model is used to generate thing and stuff segmentation maps on a target image, while the class similarity and co-occurrence knowledge help refining them. We then incorporate these maps as new cues into a multiple instance learning framework (MIL), propagating the transferred knowledge from the pixel level to the object proposal level. In extensive experiments, we conduct our transfer from the PASCAL Context dataset (source) to the ILSVRC, COCO and PASCAL VOC 2007 datasets (targets). We evaluate our transfer across widely different thing classes, including some that are not similar in appearance, but appear against similar background. The results demonstrate significant improvement over standard MIL, and we outperform the state-of-the-art in the transfer setting.
研究の動機と目的
- 境界ボックスアノテーションが欠落したクラスの弱教師付きオブジェクト検出(WSOL)を、完全アノテーションが付与されたソースデータセットの知識を活用することで向上させること。
- オブジェクト(例:車両、動物)とは別に、背景素材(例:芝生、空)を表す「ストラクチャラル(stuff)」の知識を、検出に活用するという未開拓の可能性を探索すること。
- 転送されたセマンティックセグメンテーション、クラス類似度、共起関係を統合した統一フレームワークを、複数インスタンス学習(MIL)パイプラインに組み込むこと。
- 外見が異なるが背景コンテキストを共有する多様で類似性の薄い対象クラスにおいても、本手法の有効性を実証すること。
提案手法
- ソースデータセット(PASCAL Context)で完全教師ありセマンティックセグメンテーションモデルを学習し、対象画像のインスタンスおよびストラクチャラルマップ(スコアマップおよびラベルマップ)を生成する。
- ソースから対象へ、インスタンスおよびストラクチャラルクラス間の類似度と共起関係を転送し、セグメンテーションマップの精緻化に重み関数として用いる。
- ピクセルレベルのマップからオブジェクト候補レベルへ知識を伝播させるための3つのスコアリング方式(ラベル重み付け、コントラスト重み付け、面積重み付け)を提案する。
- 精緻化されたスコアを複数インスタンス学習(MIL)フレームワークに統合し、TSTスコアを新たなヒントとして提案の順序付けを改善する。
- ソースの検証セット上で、スコアリングパラメータを共同最適化するためのプロキシ指標(ランクとCorLoc@1)を用い、対象データセットへの一般化を保証する。
- 各コンポonent(LW、CW、AW)の寄与度を検証するためのアブレーションスタディを実施する。
実験結果
リサーチクエスチョン
- RQ1インスタンスおよびストラクチャラルアノテーションを備えたソースデータセットから、境界ボックスアノテーションのない対象データセットへセマンティックセグメンテーションの知識を転送することで、弱教師付きオブジェクト検出の性能が向上するか?
- RQ2インスタンスとストラクチャラルクラス間の共起関係を転送することは、外見が異なるが背景コンテキストを共有する場合に、検出性能の向上にどの程度寄与するか?
- RQ3ラベル重み付け、コントラスト重み付け、面積重み付けの各方式が、MILフレームワークにおける提案スコアリングに、個別および統合的にどの程度向上効果をもたらすか?
- RQ4従来のインスタンス同士の転送手法とは異なり、ストラクチャラル知識(例:芝生、空)をインスタンスと併せて転送することで、性能が向上するか?
- RQ5ILSVRC、COCO、VOC 2007といった標準ベンチマークにおいて、提案手法TSTは最先端のWSOLおよび転移学習手法と比較して、どの程度優れているか?
主な発見
- TSTは標準的なDeep MILベースラインを顕著に上回り、外見ベースの類似度(APP)を用いた場合、ILSVRC-20でCorLocが7.9%絶対的に向上し、3つのスコアリング方式を組み合わせた結果、47.6%のCorLocを達成した。
- PASCAL VOC 2007では、最先端のWSOL手法[27]およびインスタンス同士の転送手法[21]を上回り、mAP 60.8%、CorLoc 47.6%を達成した。
- ILSVRC-20では、LSDA[20]の転送手法をmAPで1.5%上回り、クロスデータセット転移学習における優位性を示した。
- アブレーションスタディにより、3つのスコアリング方式(LW、CW、AW)が独立に寄与しており、3つすべてを組み合わせた場合が最高の性能(ILSVRC-20で47.6%のCorLoc)を達成した。
- プロキシ指標(ランクとCorLoc@1)により、提案されたスコア関数が、背景の候補を背景より優先して処理できることを検証した。APPベースの類似度がSEMベースの類似度よりも優れた性能を示した。
- オブジェクトネスとマルチフォールディングと組み合わせることで、性能がさらに5%向上した。これは、本手法で提案されたヒントが、既存の最先端技術と相乗効果をもたらすことを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。