[論文レビュー] Box-supervised Instance Segmentation with Level Set Evolution
本論文は、微分可能チャネル=ヴェーゼエネルギー関数を用いた反復的レベルセット進化を活用することで、ボックスラベルのみを用いた新しいワンショットでエンドツーエンドのインスタンスセグメンテーション手法を提案する。深層特徴量と入力画像をボックスプロジェクション初期化されたレベルセットと組み合わせることで、COCO、Pascal VOC、iSAID、LiTSのベンチマークで最先端の性能を達成し、特にリモートセンシングおよび医療画像分野において、従来の弱教師あり手法を著しく上回る。
In contrast to the fully supervised methods using pixel-wise mask labels, box-supervised instance segmentation takes advantage of the simple box annotations, which has recently attracted a lot of research attentions. In this paper, we propose a novel single-shot box-supervised instance segmentation approach, which integrates the classical level set model with deep neural network delicately. Specifically, our proposed method iteratively learns a series of level sets through a continuous Chan-Vese energy-based function in an end-to-end fashion. A simple mask supervised SOLOv2 model is adapted to predict the instance-aware mask map as the level set for each instance. Both the input image and its deep features are employed as the input data to evolve the level set curves, where a box projection function is employed to obtain the initial boundary. By minimizing the fully differentiable energy function, the level set for each instance is iteratively optimized within its corresponding bounding box annotation. The experimental results on four challenging benchmarks demonstrate the leading performance of our proposed approach to robust instance segmentation in various scenarios. The code is available at: https://github.com/LiWentomng/boxlevelset.
研究の動機と目的
- 完全教師ありインスタンスセグメンテーションの高コストなアノテーション問題を軽減するため、ボックスアノテーションのみで正確なピクセル単位のセグメンテーションを可能にすること。
- 複雑な疑似ラベルパイプラインや単純化されたペairワイズ類似性仮定に依存する既存のボックスラベル付き手法の限界を克服すること。
- ボックス内でのレベルセット曲線の進化を可能にする微分可能でエンドツーエンドのフレームワークを導入し、インスタンスマスクを精緻化すること。
- マスクアノテーションが限られるリモートセンシングや医療画像分野のような困難な分野におけるロバスト性を向上させること。
- 完全教師ありとボックスラベル付きインスタンスセグメンテーションの性能ギャップを埋めること。
提案手法
- 本手法は、連続的なチャネル=ヴェーゼエネルギー関数を用いたエネルギー最小化問題としてインスタンスセグメンテーションを定式化し、完全に微分可能でありエンドツーエンド学習に適している。
- SOLOv2ベースのマスクヘッドがインスタンスに依存するマスクマップを予測し、それぞれのオブジェクトの初期レベルセット関数として機能する。
- 長距離依存性を持つ深層高レベル特徴量と元の画像の両方を用いてレベルセットの進化を駆動することで、境界の正確性が向上する。
- ボックスプロジェクション関数により、各イテレーションでレベルセット曲線を初期化し、進化がアノテートされたボックス領域内に制約されることを保証する。
- エネルギー関数は反復的最適化により最小化され、レベルセット曲線が正確なオブジェクト境界に近づくように精緻化される。
- 構造的一致性を保ち、長距離依存性をモデル化するため、高レベル特徴量にツリー・フィルタを適用する。
実験結果
リサーチクエスチョン
- RQ1複雑な疑似ラベルパイプラインに依存せずに、微分可能なレベルセット進化フレームワークがボックスラベル付き条件下で強力なインスタンスセグメンテーション性能を達成できるか?
- RQ2低レベルの画像データと高レベルの深層特徴量の両方を組み込むことで、レベルセット進化のロバスト性と正確性にどのような影響を与えるか?
- RQ3ボックス領域内にレベルセット進化を制約することで、ノイズ干渉を低減し収束性を向上させられるか?
- RQ4ツリー・フィルタで強化された深層構造的特徴量は、リモートセンシングおよび医療画像分野におけるレベルセット進化にどの程度向上効果をもたらすか?
- RQ5本手法は、COCO、Pascal VOC、iSAID、LiTSといった多様なベンチマークでボックスラベル付き条件下で最先端の性能を達成できるか?
主な発見
- COCOデータセットでは、1×トレーニングスケジュールで24.7% AP、3×スケジュールで34.4% APを達成し、従来のボックスラベル付き手法を著しく上回った。
- iSAIDリモートセンシングデータセットでは、最先端の性能を達成し、既存手法と大きな差を示した。
- LiTS医療画像分野データセットでは、ツリー・フィルタを適用した特徴量を用いて36.3% APを達成し、低データ量・高変動性環境下でも優れた一般化性能を示した。
- アブレーションスタディにより、元の画像と深層特徴量の両方を用いることで24.7% APが得られ、単一入力バージョンを上回ることを確認した。
- 高レベル特徴量チャネル数の最適値は9であり、10に増加させるとノイズを含む意味的情報が増加し、性能が低下した。
- ツリー・フィルタはAPを1.9%(34.4%から36.3%)向上させ、レベルセット進化における構造的一致性の維持に有効であることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。