Skip to main content
QUICK REVIEW

[論文レビュー] CRNet: Cross-Reference Networks for Few-Shot Segmentation

Weide Liu, Chi Zhang|arXiv (Cornell University)|Mar 24, 2020
Domain Adaptation and Few-Shot Learning参考文献 27被引用数 19
ひとこと要約

CRNetは、少数ショット画像セグメンテーションのための対称的クロスリファレンスネットワークを提案する。この手法は、クロスリファレンスマジュールを通じて共起する特徴を活用し、信頼度キャッシュを用いた再帰的マスク精錬モジュールにより予測を向上させることで、サポート画像とクエリ画像の両方でマスクを同時に予測する。本手法はPASCAL VOC 2012で最先端の性能を達成し、特に5ショット設定において、複数のサポート画像を微調整することで、先行手法よりも最大8.4 mIoUの向上を達成した。

ABSTRACT

Over the past few years, state-of-the-art image segmentation algorithms are based on deep convolutional neural networks. To render a deep network with the ability to understand a concept, humans need to collect a large amount of pixel-level annotated data to train the models, which is time-consuming and tedious. Recently, few-shot segmentation is proposed to solve this problem. Few-shot segmentation aims to learn a segmentation model that can be generalized to novel classes with only a few training images. In this paper, we propose a cross-reference network (CRNet) for few-shot segmentation. Unlike previous works which only predict the mask in the query image, our proposed model concurrently make predictions for both the support image and the query image. With a cross-reference mechanism, our network can better find the co-occurrent objects in the two images, thus helping the few-shot segmentation task. We also develop a mask refinement module to recurrently refine the prediction of the foreground regions. For the $k$-shot learning, we propose to finetune parts of networks to take advantage of multiple labeled support images. Experiments on the PASCAL VOC 2012 dataset show that our network achieves state-of-the-art performance.

研究の動機と目的

  • 少数ショット画像セグメンテーションの課題に対処すること。これは、新しいカテゴリに対してわずかなアノテーション例しか与えられない状況でモデルが一般化できるようにすることを目的としている。
  • 従来の手法がサポート画像からのみ一方向のガイダンスを用いるという制限を克服すること。
  • 対称的アーキテクチャにより、サポート画像とクエリ画像の間で相互にマスクを精錬することで、マスク予測の精度を向上させること。
  • 信頼度キャッシュを用いた効果的なマスク精錬メカニズムを構築すること。このメカニズムは、各ステップで新しい確率マップをキャッシュに更新することで、反復的に予測を改善する。
  • kショット学習のための微調整ベースの戦略を提案すること。これにより、サポート画像の数が増えるにつれて性能が向上するが、特徴またはマスクの統合に基づくベースラインとは異なり、性能が飽和しないようにする。

提案手法

  • CRNetは、サポート画像とクエリ画像の両方で前景マスクを同時に予測する二本のブランチを持つエンコーダ・デコーダアーキテクチャを採用する。
  • クロスリファレンスマジュールは、両画像間の特徴を比較し、共起する物体を特定することで強化された表現を生成し、特徴の識別性を向上させる。
  • マスク精錬モジュールは信頼度マップをキャッシュとして用い、各ステップで新しい確率マップをキャッシュに更新することで、反復的に予測を精錬する。
  • kショット学習では、k個のサポート画像から得られる最大k²枚の画像ペアを用いてネットワークを微調整する。これにより、複数のラベル付き例をより効果的に活用できる。
  • ネットワークは、クエリ画像における主なセグメンテーション損失と、クロスリファレンスマジュール内の共起予測タスクからの補助損失を組み合わせた損失関数で訓練される。
  • テスト時にはマルチスケール推論とマルチレベル特徴統合を適用し、スケール変動に対するロバスト性を高めるとともに、局所化精度を向上させる。

実験結果

リサーチクエスチョン

  • RQ1一方向のガイダンスとは対照的に、サポート画像とクエリ画像の両方で対称的予測を行うことで、少数ショットセグメンテーションの性能が向上するか?
  • RQ2信頼度キャッシュに基づくマスク精錬モジュールは、反復的に前景マスク予測を改善するのにどの程度有効か?
  • RQ3複数のサポート画像を用いた微調整は、特徴またはマスクの統合に基づくベースラインと比較して、kショットセグメンテーションでより良い性能をもたらすか?
  • RQ4マルチレベル特徴とマルチスケールテストは、モデルのロバスト性と精度にどのように影響を与えるか?
  • RQ5クロスリファレンスマジュールは、共起する物体の検出とセグメンテーションのための特徴表現をどの程度向上させるか?

主な発見

  • クロスリファレンスマジュール単体でも、これを備えないベースラインと比較して10%以上のmIoU向上を達成し、特徴強化におけるその重要性を示した。
  • 信頼度キャッシュを用いたマスク精錬モジュールは、単一推論ベースラインと比較してmIoUを3.1ポイント向上させ、予測品質の顕著な向上を示した。
  • 5ショット設定では、微調整ベースの手法が統合ベースのベースラインを8.4 mIoUも上回り、さらにサポート画像の数が増えても性能が向上を続ける一方、統合手法は性能が低下し始めた。
  • マルチスケールテストは1ショット設定でmIoUを1.2ポイント向上させ、スケール変動に対するロバスト性を示した。
  • 最終層の特徴のみではなく、中間レベルのコンテキスト特徴を用いることでmIoUが1.8ポイント向上した。これは、中間レベルの特徴が重要であることを示している。
  • MS COCOでも、アブレーションスタディにより、クロスリファレンスマジュールとマスク精錬モジュールの両方が性能に顕著な寄与をしていることが確認され、フルモデルが最高のmIoUを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。