[論文レビュー] Coarse-to-fine Semantic Segmentation from Image-level Labels
本論文は、画像レベルのラベルのみを用いて反復的に粗いマスクを精錬することで、画像レベルラベルのみで学習する弱教師ありセマンティックセグメンテーションフレームワークを提案する。グラフモデルを用いて強化された非教師ありのフォアグラウンドマスクから出発し、PASCAL VOCで最先端の性能を達成する。ImageNet風の単一カテゴリラベルを用いても、オブジェクトが複数存在する画像を処理可能であり、オブジェクト毎のアノテーションが不要である。
Deep neural network-based semantic segmentation generally requires large-scale cost extensive annotations for training to obtain better performance. To avoid pixel-wise segmentation annotations which are needed for most methods, recently some researchers attempted to use object-level labels (e.g. bounding boxes) or image-level labels (e.g. image categories). In this paper, we propose a novel recursive coarse-to-fine semantic segmentation framework based on only image-level category labels. For each image, an initial coarse mask is first generated by a convolutional neural network-based unsupervised foreground segmentation model and then is enhanced by a graph model. The enhanced coarse mask is fed to a fully convolutional neural network to be recursively refined. Unlike existing image-level label-based semantic segmentation methods which require to label all categories for images contain multiple types of objects, our framework only needs one label for each image and can handle images contains multi-category objects. With only trained on ImageNet, our framework achieves comparable performance on PASCAL VOC dataset as other image-level label-based state-of-the-arts of semantic segmentation. Furthermore, our framework can be easily extended to foreground object segmentation task and achieves comparable performance with the state-of-the-art supervised methods on the Internet Object dataset.
研究の動機と目的
- ピクセル単位のアノテーションが高コストであるのを避けるために、画像レベルのカテゴリラベルのみを必要とするセマンティックセグメンテーションフレームワークの開発。
- 画像1枚につき1つのカテゴリラベルしか与えられないようなデータセット(例:ImageNet)でも学習可能にする。
- 1枚の画像に複数のオブジェクトカテゴリが存在する場合でも、1つのラベルしか与えられない状況でも対応可能にする。
- 弱教師あり情報のみを用いて、PASCAL VOCおよびフォアグラウンドセグメンテーションベンチマークで競争力のある性能を達成する。
提案手法
- CNNベースの非教師ありフォアグラウンドセグメンテーションモデルを用いて、初期の粗いマスクを生成する。
- グラフモデルを用いて粗いマスクを強化し、空間的一致性を向上させ、ノイズを低減する。
- 強化されたマスク、入力画像、画像レベルラベルを用いて、完全畳み込みネットワーク(FCN)を再帰的に訓練する。
- 再帰的な精錬プロセスにより、粗い予測から細かい予測へと段階的にマスク品質が向上する。
- 訓練中にバウンディングボックス、スクラッチ、マルチラベルアノテーションなど、他のアノテーションは一切使用しない。
- 本手法はフォアグラウンドオブジェクトセグメンテーションへも応用可能であり、MIT Object Discoveryデータセットでも競争力のある結果を達成している。
実験結果
リサーチクエスチョン
- RQ1単純で誤りの可能性のある画像レベルカテゴリラベルのみで、セマンティックセグメンテーションを効果的に学習できるか?
- RQ2ImageNetのような単一カテゴリラベルの画像で学習したモデルが、複数のオブジェクトカテゴリを含む画像にも一般化できるか?
- RQ3完全畳み込みネットワークを用いた粗いマスクの再帰的精錬は、弱教師あり条件下でピクセル単位のセグメンテーションを達成するためにどの程度有効か?
- RQ4提案されたグラフ強化による粗いマスク精錬は、直接の精錬と比較して最終的なセグメンテーション性能を向上させるか?
主な発見
- 提案手法は、PASCAL VOC 2012データセットにおいて、最先端の画像レベルラベルベースのセマンティックセグメンテーション手法と同等の性能を達成した。
- ノイズを含む単一カテゴリラベル(ImageNetラベル)で学習した場合でも、既存の多くの画像レベルラベルベース手法を上回る性能を示した。
- MIT Object Discoveryデータセットでは、69.9%の平均IoUを達成し、人為的アノテーションマスクを用いた教師あり手法と比較して2.06%低い結果であった。
- 混同行列から、多くのカテゴリ(例:Bird, Sheep, Train)において高いクラス別IoUが得られており、いくつかのクラスではピクセル精度が80%を超えていた。
- 定性的な結果から、1枚の画像に複数のオブジェクトカテゴリが存在する状況でも、1つのラベルしか与えられていないにもかかわらず、モデルがそれらを正しく区別できていることが示された。
- 再帰的精錬プロセスにより、ノイズが多く粗いマスクが、正確でピクセル単位のセマンティックセグメンテーションマスクへと効果的に変換された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。