[論文レビュー] BoxTeacher: Exploring High-Quality Pseudo Labels for Weakly Supervised Instance Segmentation
BoxTeacher は、ボックススラムドモデルから得られる高品質な偽マスクを活用する、弱教師付きインスタンスセグメンテーションのエンドツーエンドで自己学習可能なフレームワークを提案する。マスクに特化した信頼スコアとノイズに特化した損失関数を導入することで、信頼性の高い偽マスクを効果的に選別し、学生モデルの性能を向上させる。ResNet-50 を用いた COCO で 35.0 のマスク AP を達成し、ResNet-101 を用いることで 36.5 を達成する。これは、従来の手法を著しく上回り、完全教師ありアプローチとの差を縮めている。
Labeling objects with pixel-wise segmentation requires a huge amount of human labor compared to bounding boxes. Most existing methods for weakly supervised instance segmentation focus on designing heuristic losses with priors from bounding boxes. While, we find that box-supervised methods can produce some fine segmentation masks and we wonder whether the detectors could learn from these fine masks while ignoring low-quality masks. To answer this question, we present BoxTeacher, an efficient and end-to-end training framework for high-performance weakly supervised instance segmentation, which leverages a sophisticated teacher to generate high-quality masks as pseudo labels. Considering the massive noisy masks hurt the training, we present a mask-aware confidence score to estimate the quality of pseudo masks and propose the noise-aware pixel loss and noise-reduced affinity loss to adaptively optimize the student with pseudo masks. Extensive experiments can demonstrate the effectiveness of the proposed BoxTeacher. Without bells and whistles, BoxTeacher remarkably achieves 35.0 mask AP and 36.5 mask AP with ResNet-50 and ResNet-101 respectively on the challenging COCO dataset, which outperforms the previous state-of-the-art methods by a significant margin and bridges the gap between box-supervised and mask-supervised methods. The code and models will be available at https://github.com/hustvl/BoxTeacher.
研究の動機と目的
- ボックススラムドモデルから得られる高品質な偽セグメンテーションマスクが、弱教師付きインスタンスセグメンテーションに効果的に活用できるかどうかを調査すること。
- ノイズの多い偽マスクや一般化性能の低さによって妨げられる、単純な自己学習の限界を克服すること。
- 教師と学生の間での相互改善を促進することで、モデル性能を向上させる、堅牢でエンドツーエンドの学習フレームワークを構築すること。
- 新しいマスクに特化した信頼スコアとノイズに特化した損失関数を用いて、低品質な偽マスクの影響を低減すること。
提案手法
- 教師ネットワークがボックスベースの偽マスク割り当て戦略を用いて、高品質な偽インスタンスマスクを生成し、それらを正例ボックスに割り当てる。
- 各偽マスクの品質を推定するためのマスクに特化した信頼スコアを導入し、低品質な予測をフィルタリングする。
- ノイズに特化したピixe ロスとノイズ低減型アフィニティロスを用いて、正例ボックスと偽マスクの両方で学生ネットワークを学習させる。
- 指数的移動平均(EMA)を用いて、学生の重みの変化に応じて教師ネットワークを段階的に更新する。
- 学生の入力画像に強いデータ拡張を適用し、一貫性と耐性を向上させる。
- フレームワークはエンドツーエンドであり、基礎となるインスタンスセグメンテーションアーキテクチャに依存しないため、広範な適用が可能である。
実験結果
リサーチクエスチョン
- RQ1ボックススラムドモデルから生成された高品質な偽セグメンテーションマスクが、弱教師付きインスタンスセグメンテーションの向上に効果的に活用できるか。
- RQ2高品質なマスクが存在するにもかかわらず、なぜ単純な自己学習では顕著な向上が得られないのか。
- RQ3弱教師付きインスタンスセグメンテーションの自己学習において、ノイズの多い偽マスクの影響をどのように低減できるか。
- RQ4信頼スコアとノイズに特化した損失関数を備えた協調的教師-学生フレームワークは、標準的な自己学習を上回る性能を達成できるか。
- RQ5データ拡張による一貫性正則化は、ノイズの多い偽ラベルからの学習をどの程度向上させるか。
主な発見
- BoxTeacher は、ResNet-50 を用いた COCO で 35.0 のマスク AP、ResNet-101 を用いた場合で 36.5 のマスク AP を達成し、従来の最先端手法を著しく上回っている。
- 提案されたマスクに特化した信頼スコアは、IoU や平均エントロピー、IoU を用いた信頼スコアといった代替手法よりも優れた性能を示している。
- 偽マスクを用いた単純な自己学習は、ボックスのみのアノテーションで学習するよりも性能が悪いことが判明し、ノイズに特化した学習戦略の必要性が示された。
- BoxTeacher は、標準的な学習よりも強いデータ拡張に対してより頑健であり、特に長い訓練スケジュール下で顕著である。
- 強い拡張を用いることで、弱教師付き性能が +0.6 AP 向上するが、完全教師あり検出ではほとんど効果がなく、これは拡張がノイズの多い偽ラベルの処理に寄与していることを示唆している。
- 指数的移動平均(EMA)は性能にほとんど影響を及ぼさないため、BoxTeacher の向上は主に偽ラベル付けの効果に起因し、モデル平均化によるものではないことが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。