[論文レビュー] Weakly Supervised Semantic Image Segmentation with Self-correcting Networks
本論文は、マスクとバウンディングボックスを備えた完全にアノテートされた画像の少数と、バウンディングボックスのみのアノテーションを持つより多くの画像を使用して、主なセマンティックセグメンテーションモデルを訓練する弱教師ありセマンティック画像セグメンテーションフレームワークを提案する。アシスタントモデルを用いて弱教師ありセットのための擬似ラベルを生成し、線形関数または畳み込み層を用いた自己補正モジュールを用いて、トレーニング中にこれらのラベルを反復的に精錬する。PASCAL VOC 2012およびCityscapesにおいて、完全教師ありモデルと同等またはそれ以上の性能を達成し、アノテーション作業量を約7倍削減できる。
Building a large image dataset with high-quality object masks for semantic segmentation is costly and time consuming. In this paper, we introduce a principled semi-supervised framework that only uses a small set of fully supervised images (having semantic segmentation labels and box labels) and a set of images with only object bounding box labels (we call it the weak set). Our framework trains the primary segmentation model with the aid of an ancillary model that generates initial segmentation labels for the weak set and a self-correction module that improves the generated labels during training using the increasingly accurate primary model. We introduce two variants of the self-correction module using either linear or convolutional functions. Experiments on the PASCAL VOC 2012 and Cityscape datasets show that our models trained with a small fully supervised set perform similar to, or better than, models trained with a large fully supervised set while requiring ~7x less annotation effort.
研究の動機と目的
- ピクセル単位のマスクに依存することを最小限に抑えることで、セマンティック画像セグメンテーションのアノテーションコストを低減すること。
- 高品質な完全アノテート済みセグメンテーションデータセットの入手制限という課題に対処すること。
- 完全教師ありデータ(マスクとボックス)と弱教師ありデータ(ボックスのみ)の両方を活用する半教師ありフレームワークを開発すること。
- 自己補正メカニズムを用いて反復的に精錬することで、弱教師あり画像の擬似ラベル品質を向上させること。
- 完全教師ありモデルと同等またはそれ以上の性能を達成しつつ、アノテーション作業量を著しく削減すること。
提案手法
- マスクとバウンディングボックスを備えた完全にアノテートされた画像の少数を用いて、主なセグメンテーションモデルを訓練する。
- アシスタントモデルを用いて、弱教師あり画像(ボックスのみのアノテーション)の初期擬似セグメンテーションラベルを生成する。
- 主なモデルが徐々に正確になるにつれて、その特徴を用いて擬似ラベルを精錬する自己補正モジュールを導入する。
- 自己補正モジュールの2種類のバリエーションを実装する:1つは線形関数を用い、もう1つは空間的依存性をモデル化する畳み込み層を用いる。
- 主なモデルからの勾配を用いてトレーニング中に自己補正モジュールを更新し、段階的なラベル精錬を可能にする。
- 弱教師あり学習パイプラインにおいて、主なモデルと自己補正モジュールをエンドツーエンドで同時に最適化する。
実験結果
リサーチクエスチョン
- RQ1マスクとバウンディングボックスを備えた完全にアノテートされた画像の少数と、ボックスのみのアノテーションを持つ多数の画像のみを用いて、セマンティックセグメンテーションモデルが高い性能を達成できるか?
- RQ2自己補正モジュールは、トレーニングの反復回数を経て、擬似ラベル品質をどの程度向上させるか?
- RQ3自己補正モジュールに畳み込み関数を用いることで、線形関数を用いる場合よりも高い性能が得られるか?
- RQ4提案されたフレームワークは、完全教師ありモデルと同等またはそれ以上の性能を達成できるか? また、アノテーションコストを約7倍削減できるか?
- RQ5PASCAL VOC 2012およびCityscapesのような多様なデータセットに、このフレームワークはどのように一般化するか?
主な発見
- 提案されたフレームワークは、完全にアノテートされた画像の少数のみを用いても、完全教師ありモデルと同等またはそれ以上の性能を達成する。
- PASCAL VOC 2012では、1,464枚の完全にアノテートされた画像と10,000枚のボックスのみの画像を用いて、平均交差率(mIoU)72.1%を達成した。
- Cityscapesでは、同じアノテーション予算でmIoUが74.8%に達し、より大きな完全アノテート済みデータセットで学習した完全教師ありモデルを上回った。
- 自己補正モジュールは擬似ラベル品質を顕著に向上させ、トレーニング全体を通して一貫した性能向上をもたらした。
- 畳み込み層を用いた自己補正モジュールのバリエーションは、線形関数を用いたものよりも優れた性能を示し、空間的コンテキストをモデル化することでラベル精錬が向上することを示している。
- フレームワークは完全教師あり学習と比較して、約7倍のアノテーション作業量を削減しながら、セグメンテーション精度を維持または向上させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。