Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Segment Every Thing

Ronghang Hu, Piotr Dollár|arXiv (Cornell University)|Nov 28, 2017
Advanced Image and Video Retrieval Techniques参考文献 30被引用数 15
ひとこと要約

この論文は、マスクアノテーションが付与された80 COCOクラスと、ボクシングボックスアノテーションのみが付与された3000 Visual Genomeクラスの混合データセットを用いて、検出特徴からマスクを予測する学習された重み転送関数を用いて、Mask R-CNNを部分的に教師付きで訓練する部分的教師付きインスタンスセグメンテーションフレームワークを提案する。この手法は、未学習カテゴリにおけるマスクAPを40%相対的に向上させ、最小限のマスク監視で数千の概念にわたる大規模インスタンスセグメンテーションを実現する。

ABSTRACT

Most methods for object instance segmentation require all training examples to be labeled with segmentation masks. This requirement makes it expensive to annotate new categories and has restricted instance segmentation models to ~100 well-annotated classes. The goal of this paper is to propose a new partially supervised training paradigm, together with a novel weight transfer function, that enables training instance segmentation models on a large set of categories all of which have box annotations, but only a small fraction of which have mask annotations. These contributions allow us to train Mask R-CNN to detect and segment 3000 visual concepts using box annotations from the Visual Genome dataset and mask annotations from the 80 classes in the COCO dataset. We evaluate our approach in a controlled study on the COCO dataset. This work is a first step towards instance segmentation models that have broad comprehension of the visual world.

研究の動機と目的

  • すべてのクラスに完全なマスクアノテーションを必要とせずに、数千のオブジェクトカテゴリに一般化可能なインスタンスセグメンテーションモデルを実現すること。
  • インスタンスマスクアノテーションの高コストと希少性に対処するため、豊富で安価なボクシングボックスアノテーションを活用すること。
  • 検出特徴のみを入力として用いて、未学習カテゴリのマスク予測を可能にする転移学習手法を開発すること。
  • 従来のモデルが通常対応する100クラス程度の制限を超えて、広範な視覚的世界理解を実現するインスタンスセグメンテーションのスケーリングを達成すること。
  • Visual Genome や COCO のようなデータセットからの部分的監視を用いて、大規模インスタンスセグメンテーションの実現可能性を示すこと。

提案手法

  • 一部のクラス(80 COCOクラス)にマスクアノテーションが付与されたが、残りのクラス(3000 VGクラス)にはボクシングボックスアノテーションのみが付与された、新しい部分的教師付きインスタンスセグメンテーションタスクを提案する。
  • 各クラスの検出ヘッド特徴からセグメンテーションマスクヘッドの重みを予測するパラメータ化された重み転送関数 $\mathcal{T}$ を導入する。
  • マスクアノテーションが付与された80クラスのみを用いて、重み転送関数をエンドツーエンドで訓練し、推論時に未学習クラスへ転送可能にする。
  • 多様なカテゴリにわたる一般化を向上させるために、クラスに依存しないマルチレイヤーパーセプトロン(MLP)をマスクヘッドに追加する。
  • 2段階の訓練戦略を採用する:まず、Visual Genomeのボクシングボックスを用いて3000クラスでFaster R-CNN検出器を訓練し、次に、COCOのマスクを用いて重み転送関数でマスクヘッドをファインチューニングする。
  • バックボーンネットワークとしてResNet-101-FPNを用い、定量的評価のためのCOCOおよび定性的スケーリングのためのVisual Genomeの両方でこの手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1マスクアノテーションが一部のクラスにのみ付与され、他の大部分のクラスにはボクシングボックスアノテーションのみが与えられた場合、深層学習モデルが数千のオブジェクトカテゴリに一般化してインスタンスセグメンテーションを実現できるか?
  • RQ2検出特徴からセグメンテーションマスク予測へと知識を転送するための学習された重み転送関数は、未学習カテゴリにおいてどの程度効果的か?
  • RQ3COCOのようなマスクアノテーションが付与された少数のクラスで学習したモデルが、意味的に多様でボクシングボックスアノテーションのみが与えられた非常に多数のクラス(例:Visual Genome)にどの程度一般化できるか?
  • RQ4現実世界のデータセットで部分的監視を用いて訓練された大規模インスタンスセグメンテーションモデルの定性的な能力は何か?
  • RQ5提案手法は、訓練用マスクが一切ないカテゴリにおいて、強力なベースラインと比較してマスクAPを顕著に向上させられるか?

主な発見

  • COCOデータセットにおいて、提案手法はマスクアノテーションが付与されていないカテゴリで、強力なベースラインと比較して40%の相対的向上を達成した。
  • マスクアノテーションが付与されたGrabCutマスクで訓練されたMask R-CNNと比較して、マスクAPが20%以上の相対的向上を示した。
  • 重み転送関数により効果的な一般化が実現された:マスク監視が一切ないにもかかわらず、COCOと重複しない2920のVisual Genomeクラスに対しても、妥当なマスクセグメンテーションを生成した。
  • Visual Genomeにおける定性的な結果から、モデルは影や道といった抽象的概念をセグメンテーションでき、物体全体と部分(例:窓、ハンドル)を区別する能力も示した。
  • 「もの(thing)」的コンセプト(例:孤立した木)よりも、「素材(stuff)」的コンセプト(例:森)を処理する際にはやや信頼性が低く、意味的曖昧さの処理に限界があることが示された。
  • 異なるバックボーンアーキテクチャ(ResNet-50-FPNおよびResNet-101-FPN)に対しても一般化が可能であり、両方のバックボーンで一貫した性能向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。