Skip to main content
QUICK REVIEW

[論文レビュー] Box2Mask: Box-supervised Instance Segmentation via Level-set Evolution

Wentong Li, Wenyu Liu|arXiv (Cornell University)|Dec 3, 2022
Advanced Neural Network Applications被引用数 8
ひとこと要約

Box2Maskは、境界ボックスの教師付き条件下でのみ、深層特徴量と局所的一致モジュールを用いてレベルセットの進化を繰り返し最適化することでマスクを最適化する、新規のワンショットインスタンスセグメンテーションフレームワークを提案する。スイッチトランスフォーマー大規模バックボーンを用いることでCOCOで42.4%のマスクAPを達成し、完全教師あり手法と同等の性能を示し、境界ボックス教師ありインスタンスセグメンテーション分野で新たなSOTAを樹立した。

ABSTRACT

In contrast to fully supervised methods using pixel-wise mask labels, box-supervised instance segmentation takes advantage of simple box annotations, which has recently attracted increasing research attention. This paper presents a novel single-shot instance segmentation approach, namely Box2Mask, which integrates the classical level-set evolution model into deep neural network learning to achieve accurate mask prediction with only bounding box supervision. Specifically, both the input image and its deep features are employed to evolve the level-set curves implicitly, and a local consistency module based on a pixel affinity kernel is used to mine the local context and spatial relations. Two types of single-stage frameworks, i.e., CNN-based and transformer-based frameworks, are developed to empower the level-set evolution for box-supervised instance segmentation, and each framework consists of three essential components: instance-aware decoder, box-level matching assignment and level-set evolution. By minimizing the level-set energy function, the mask map of each instance can be iteratively optimized within its bounding box annotation. The experimental results on five challenging testbeds, covering general scenes, remote sensing, medical and scene text images, demonstrate the outstanding performance of our proposed Box2Mask approach for box-supervised instance segmentation. In particular, with the Swin-Transformer large backbone, our Box2Mask obtains 42.4% mask AP on COCO, which is on par with the recently developed fully mask-supervised methods. The code is available at: https://github.com/LiWentomng/boxlevelset.

研究の動機と目的

  • 完全教師ありインスタンスセグメンテーションにおける高いアノテーションコストを低減するため、境界ボックスアノテーションのみで正確なマスク予測を可能にする。
  • 単純なペairワイズ類似度モデリングに代わり、物理的に根拠を持つレベルセット進化フレームワークを導入することで、境界ボックス教師ありインスタンスセグメンテーションにおけるロバスト性と境界精度を向上させる。
  • 古典的なレベルセットモデルをディープニューラルネットワークに統合し、境界ボックスの教師付き条件下でエンドツーエンドで微分可能なマスク最適化を実現する。
  • CNNベースおよびトランスフォーマー基地のワンステージアーキテクチャを両方開発し、局所的一致性とボックスレベルのマッチングを伴う繰り返しレベルセット進化をサポートする。
  • 境界ボックス教師ありと完全マスク教師ありのインスタンスセグメンテーション手法の間の性能ギャップを埋める。

提案手法

  • 本手法は、微分可能な損失として古典的なチャン=ヴェーズのレベルセットエネルギー関数を用い、物体境界曲線の暗黙的進化を実現する。
  • 入力画像と深層特徴量を両方入力としてレベルセット進化に使用することで、マルチスケールおよびマルチレベルのコンテキストモデリングが可能になる。
  • ボックスプロジェクション関数により、各イテレーションでレベルセット曲線を初期化し、与えられた境界ボックス内での粗い境界推定値を提供する。
  • ピクセル類似度カーネルに基づく局所的一致モジュールが、空間的および外観的関係をマイニングし、進化過程での一貫性を強化する。
  • エンドツーエンドでトレーニング可能なインスタンスに特化したデコーダーとボックスレベルマッチングアサインメントモジュールをフレームワークに統合し、予測と真値ボックスを関連付ける。
  • レベルセットエネルギー関数を繰り返し最小化することで、ピクセル単位の教師信号を一切必要とせず、各境界ボックス内でのマスク予測を改善する。

実験結果

リサーチクエスチョン

  • RQ1微分可能なエネルギー関数を用いたレベルセット進化を、境界ボックス教師ありインスタンスセグメンテーションに効果的に統合できるか?
  • RQ2類似度カーネルを用いた局所的一致モデリングは、境界ボックス教師あり条件下でマスク境界の正確性をどのように向上させるか?
  • RQ3レベルセット進化を組み込んだワンステージフレームワークは、従来のペアワイズ類似度ベース手法を上回る性能を示せるか?
  • RQ4アーキテクチャ設計(CNN対トランスフォーマー)が、レベルセットベースのマスク精錬性能に与える影響は何か?
  • RQ5境界ボックス教師あり手法は、完全教師ありインスタンスセグメンテーション手法との性能ギャップをどの程度縮められるか?

主な発見

  • Box2Maskはスイッチトランスフォーマー大規模バックボーンを用いてCOCOで42.4%のマスクAPを達成し、最近の完全マスク教師あり手法と同等の性能を示した。
  • 50エポックのトレーニングスケジュールを用いたBox2Mask-Tは、Pascal VOCで41.4%のマスクAPを達成し、長時間トレーニングの利点を示した。
  • ダイレータ率3の局所的一致モジュールが最良の性能(36.3% AP)を示し、局所的コンテキストが最も有益であることを示した。
  • ピクセルデコーダーに2つのMSDeformAtten層を用いることで、1層の場合に比べてマスクAPが2.1%向上し、5層がピーク性能(39.4% AP)を記録した。
  • ボックスレベルマッチングアサインメントの最適なバランス重みはβ₁=2.0およびβ₂=6.0であり、トランスフォーマー基盤モデルで39.4%のAPを達成した。
  • 一般シーン、リモートセンシング、医療画像、シーンテキスト画像の5つの多様なベンチマークにおいて、Box2Maskはすべてのデータセットで新たなSOTAを樹立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。