[論文レビュー] DiscoBox: Weakly Supervised Instance Segmentation and Semantic Correspondence from Box Supervision
DiscoBoxは、境界ボックスのアノテーションのみを用いて、弱教師付きインスタンスセグメンテーションとセマンティックコアポンネンスを同時に学習する自己アンサンブルフレームワークを提案する。構造的テイチャーモデルを用い、単一項、ペアワイズ、およびクロス画像のポテンシャルを統合することで、両タスクのための疑似ラベルを生成する。その結果、SOTA性能を達成し、COCOでは37.9% AP、PASCAL VOC12およびPF-PASCALでもSOTA結果を達成した。
We introduce DiscoBox, a novel framework that jointly learns instance segmentation and semantic correspondence using bounding box supervision. Specifically, we propose a self-ensembling framework where instance segmentation and semantic correspondence are jointly guided by a structured teacher in addition to the bounding box supervision. The teacher is a structured energy model incorporating a pairwise potential and a cross-image potential to model the pairwise pixel relationships both within and across the boxes. Minimizing the teacher energy simultaneously yields refined object masks and dense correspondences between intra-class objects, which are taken as pseudo-labels to supervise the task network and provide positive/negative correspondence pairs for dense constrastive learning. We show a symbiotic relationship where the two tasks mutually benefit from each other. Our best model achieves 37.9% AP on COCO instance segmentation, surpassing prior weakly supervised methods and is competitive to supervised methods. We also obtain state of the art weakly supervised results on PASCAL VOC12 and PF-PASCAL with real-time inference.
研究の動機と目的
- インスタンスセグメンテーションマスクと密度的なセマンティックコアポンネンスを併せ持つ大規模なデータセットの不足に対処する。
- インスタンスセグメンテーションとセマンティックコアポンネンスの分離されたアプローチの限界を克服し、相互監督を可能にする。
- インスタンスセグメンテーションとセマンティックコアポンネンスの両方のタスクを、境界ボックスアノテーションのみを用いて学習する弱教師付きフレームワークを開発する。
- 局所化の向上がコアポンネンス品質を向上させ、逆にコアポンネンスの向上が局所化を強化する相互作用的な学習関係を確立する。
- PASCAL 3D+に特化した、原理的で整合性のある評価指標を備えた、複数オブジェクトを対象とした新しいセマンティックコアポンネンスベンチマークを導入する。
提案手法
- 境界ボックスの監督のもとで、タスクネットワークが初期のマスクとコアポンネンスを予測する自己アンサンブルフレームワークを設計する。
- 単一項、ペアワイズ、およびクロス画像のポテンシャルを有するGibbsエネルギー関数としての構造的テイチャーモデルを構築し、予測を精緻化する。
- テイチャーのエネルギー最小化を用いて、インスタンスセグメンテーションおよび密度的コアポンネンスの両方の高品質な疑似ラベルを生成する。
- テイチャー出力から導出された正例および負例のコアポンネンスペアを用いた密度的コントラスト学習を統合し、表現学習を向上させる。
- クラス内コアポンネンスとオブジェクト局所化を相互に監視信号として活用し、ボックス監督における曖昧さを低減する。
- テイチャーからの疑似ラベルを用いてタスクネットワークをエンドツーエンドで訓練し、大規模な弱教師付きデータに対してスケーラブルな学習を可能にする。
実験結果
リサーチクエスチョン
- RQ1境界ボックスの監督のみから、インスタンスセグメンテーションとセマンティックコアポンネンスを同時に学習できるか?
- RQ2クラス内およびクロス画像のポテンシャルを有する構造的テイチャーモデルは、両タスクの疑似ラベル品質をどのように向上させるか?
- RQ3弱教師付き環境下で、密度的コントラスト学習がコアポンネンスおよびセグメンテーション表現の向上に与える影響は何か?
- RQ4局所化とコアポンネンスの相互監視は、ボックス監督学習における自明な解の出現を抑えることができるか?
- RQ5提案フレームワークは、マルチオブジェクトシナリオにどのように一般化できるか?また、既存の弱教師付き手法に比べ、セマンティックコアポンネンスベンチマークで優れた性能を示すか?
主な発見
- DiscoBoxはCOCOインスタンスセグメンテーションで37.9% APを達成し、YOLACT++(34.6% AP)やMask R-CNN(37.1% AP)といった教師あり手法を上回った。
- PASCAL VOC12では59.3% PCK@0.05を達成し、DCC-Net(55.6%)やNC-Net(54.3%)といった先行SOTA手法を上回った。
- PF-PASCALベンチマークでは95.3% PCK@0.15を達成し、弱教師付きセマンティックコアポンネンス分野でSF-Net(90.6%)やDHPF(91.1%)を大きく上回った。
- PASCAL 3D+では31.7% APを達成し、SCOT(29.3%)やアブレーション版のDiscoBox-(30.9%)を上回り、フルフレームワークの有効性を示した。
- アブレーションスタディの結果、密度的コントラスト学習と構造的テイチャーが性能向上に不可欠であることが確認され、テイチャー単体でもベースラインから1.8% AP向上した。
- 微調整なしに、COCO、VOC12、PF-PASCAL、PASCAL 3D+の各データセットに良好に一般化する能力を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。