Skip to main content
QUICK REVIEW

[論文レビュー] Show, Match and Segment: Joint Weakly Supervised Learning of Semantic Matching and Object Co-segmentation

Yunchun Chen, Yen‐Yu Lin|arXiv (Cornell University)|Jun 13, 2019
Advanced Neural Network Applications参考文献 95被引用数 4
ひとこと要約

本論文は、タスク間の一貫性を活用することで、セマンティックマッチングとオブジェクト共同セグメンテーションを共同最適化する弱教師付きエンドツーエンド学習可能な2ストリームネットワークを提案する。予測マスクを用いてマッチングにおける背景の雑音を低減し、密な対応を用いてセグメンテーションにおける幾何的一致性を強制することで、画像レベルの監視のみを用いて5つのベンチマークで最先端の性能を達成した。

ABSTRACT

We present an approach for jointly matching and segmenting object instances of the same category within a collection of images. In contrast to existing algorithms that tackle the tasks of semantic matching and object co-segmentation in isolation, our method exploits the complementary nature of the two tasks. The key insights of our method are two-fold. First, the estimated dense correspondence fields from semantic matching provide supervision for object co-segmentation by enforcing consistency between the predicted masks from a pair of images. Second, the predicted object masks from object co-segmentation in turn allow us to reduce the adverse effects due to background clutters for improving semantic matching. Our model is end-to-end trainable and does not require supervision from manually annotated correspondences and object masks. We validate the efficacy of our approach on five benchmark datasets: TSS, Internet, PF-PASCAL, PF-WILLOW, and SPair-71k, and show that our algorithm performs favorably against the state-of-the-art methods on both semantic matching and object co-segmentation tasks.

研究の動機と目的

  • 背景の雑音とオブジェクトカバレッジの不完全さに苦しむ独立したセマンティックマッチングおよびオブジェクト共同セグメンテーション手法の限界を解消すること。
  • セマンティックマッチングとオブジェクト共同セグメンテーションの相補的性質を活用し、両タスクの性能を向上させること。
  • 手作業によるアノテーションに代わる、コストの高いラベルを必要としない弱教師付きエンドツーエンド学習可能なモデルを構築すること(すなわち、共通のオブジェクトを含む画像ペアのみを必要とする)。
  • 予測マスクと画像ペア間の密な対応の間で幾何的および外観的一致性を強制する、クロスネットワーク一貫性損失を導入すること。
  • 共同最適化を通じて、クラス内変動、スケール、ポーズ、視点の違いに対する耐性を向上させること。

提案手法

  • 本手法は2ストリームネットワークを採用する。1つのストリームはセマンティックマッチングのための密な対応フィールドを予測し、もう1つのストリームは共同セグメンテーションのための前景オブジェクトマスクを予測する。
  • 予測マスクが別のストリームの密な対応と幾何的に一貫していることを強制するため、クロスネットワーク一貫性損失を導入する。
  • セマンティックマッチングのため、予測された画像変換の幾何的妥当性を向上させるためにサイクル一貫性損失を適用する。
  • オブジェクト共同セグメンテーションのため、閾値 $m$ を用いたカットオフ閾値を用いて、外観の類似性を強化するとともに、図形-背景の相違を強制する知覚的対照的損失を適用する。
  • キーポイント対応やオブジェクトマスクのアノテーションを一切必要とせず、画像レベルの監視のみでエンドツーエンドに学習する。
  • 後処理としてDenseCRF、Otsuの方法、またはGrabCutを適用し、マスクの精錬を図るが、各手法間での性能差は最小限にとどまる。

実験結果

リサーチクエスチョン

  • RQ1独立したアプローチと比較して、セマンティックマッチングとオブジェクト共同セグメンテーションを共同で学習することで、両タスクの性能が向上するか?
  • RQ2予測マスクと密な対応からのタスク間監視は、背景の雑音や外観の変動に対する耐性をどのように向上させるか?
  • RQ3クロスネットワーク一貫性損失は、弱教師付き設定において幾何的および外観的一致性をどの程度向上させるか?
  • RQ4知覚的対照的損失におけるカットオフ閾値 $m$ のようなハイパーパrameterの選択に、モデルの性能はどの程度敏感か?
  • RQ5手作業によるアノテーションなしに、弱教師付きでエンドツーエンド学習可能なフレームワークが最先端の結果を達成できるか?

主な発見

  • 提案手法は、TSS、Internet、PF-PASCAL、PF-WILLOW、SPair-71kの5つのベンチマークデータセットにおいて、セマンティックマッチングおよびオブジェクト共同セグメンテーションの両タスクで最先端の性能を達成した。
  • カットオフ閾値 $m$ を2に設定した場合、知覚的対照的損失が最適な性能を発揮し、精度 $\mathcal{P}$ とJaccard指数 $\mathcal{J}$ が向上した。$m$ を5または10に増加させると性能が低下した。
  • サイクル一貫性損失、知覚的対照的損失、またはクロスネットワーク一貫性損失のいずれかの損失項を無効化すると、顕著な性能低下が生じ、各損失項の寄与が確認された。
  • 損失のハイパーパrameterを高すぎると(例:1,000)、その項が学習目的を支配し、性能が劣化することが示され、ハイパーパrameterチューニングへの感受性が裏付けられた。
  • GTX 1080 GPU上で、1枚の画像を平均21秒で処理し、TSSデータセットの800枚の画像に対して合計280分の推論時間を要した。
  • DenseCRF、Otsuの方法、またはGrabCutによる後処理は、類似した性能を示し、モデルのセグメンテーション出力がさまざまな精錬手法に対して堅牢で安定していることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。