Skip to main content
QUICK REVIEW

[論文レビュー] From colouring-in to pointillism: revisiting semantic segmentation supervision

Rodrigo Benenson, Vittorio Ferrari|arXiv (Cornell University)|Oct 25, 2022
COVID-19 diagnosis using AI被引用数 9
ひとこと要約

本論文は、画素単位のラベル付けではなく、ポイント単位のクラス存在に関する簡単な「はい/いいえ」質問に回答することで行う、セマンティックセグメンテーションのポイントリスチック(点描的)アノテーションパラダイムを提案する。この手法により、140万枚の画像にわたる4,171クラスのスケーラブルで高速かつ信頼性の高いラベリングが可能となり、Open Images V7で2,260万ポイントラベルが公開された。これは、密集ラベル付けなしに高品質なセグメンテーションモデルを訓練できることを示している。

ABSTRACT

The prevailing paradigm for producing semantic segmentation training data relies on densely labelling each pixel of each image in the training set, akin to colouring-in books. This approach becomes a bottleneck when scaling up in the number of images, classes, and annotators. Here we propose instead a pointillist approach for semantic segmentation annotation, where only point-wise yes/no questions are answered. We explore design alternatives for such an active learning approach, measure the speed and consistency of human annotators on this task, show that this strategy enables training good segmentation models, and that it is suitable for evaluating models at test time. As concrete proof of the scalability of our method, we collected and released 22.6M point labels over 4,171 classes on the Open Images dataset. Our results enable to rethink the semantic segmentation pipeline of annotation, training, and evaluation from a pointillism point of view.

研究の動機と目的

  • セマンティックセグメンテーションにおける画素単位のラベル付けのスケーラビリティのボトルネックを解決すること。
  • 塗りつぶしを単純なポイント単位の「はい/いいえ」質問に置き換えることで、ラベリング時間と認知的負荷を低減すること。
  • 最小限のトレーニングと高い並列処理を活用して、数千クラスにわたる大規模ラベリングを可能とすること。
  • 疎なポイントラベルが、効果的にセグメンテーションモデルの訓練および評価に使用できることを実証すること。

提案手法

  • 機械学習モデルを用いて高い不確実性を持つポイントを選別し、人間のラベラーにそのポイントにおけるクラス存在について「はい/いいえ」質問を提示する。
  • アクティブラーニングを活用して、曖昧または不確実な領域に焦点を当て、段階的にラベルを精錬する。
  • 各ポイントに対して複数のラベラーの回答を集約して信頼性を向上させ、解決不能なケースはレビュー用にマークする。
  • 既存の画像レベルラベルを活用し、ポイントラベルを統合されたデータパイプラインに統合して、訓練および評価に使用する。
  • クラスの分布をモデル化するためにジプフの法則を適用し、レアクラスは少ないラベル数で済ませる。
  • ポイントラベルを変換・統合し、Open Images V7に統合することで、140万枚の画像に5,827クラスをサポートする。

実験結果

リサーチクエスチョン

  • RQ1ポイントリスチックアノテーション戦略は、ラベル品質を維持したまま、著しくラベル付け時間を短縮できるか?
  • RQ2疎なポイントレベルラベルのみを用いて、効果的なセマンティックセグメンテーションモデルを訓練することは可能か?
  • RQ3単純な「はい/いいえ」質問への回答と、密集ラベル付けとの間で、人間のラベラーのパフォーマンスに差はあるか?
  • RQ4ポイントベースのラベルは、テスト時の信頼性の高いモデル評価を可能とするか?
  • RQ5提案手法は、数千クラスおよび大規模データセットに対して効果的にスケーリング可能か?

主な発見

  • ラベラーは1回の回答に対して平均1.1秒で対応し、高速かつ効率的であることが示された。
  • 3回の回答があるポイントについて、人間の合意率は98%に達し、ラベルの一貫性が確認された。
  • 4,171クラスにわたる2,260万ポイントラベルがデータセットに含まれており、そのうち420万件が「はい」、1,610万件が「いいえ」の回答であった。
  • 3,189クラスが少なくとも1件のポジティブ(「はい」)ラベルを保有しており、2,664クラスが3件以上を有しており、広範なクラスカバレッジが得られた。
  • クラスごとの「はい」回答の分布はジプフの法則に従っており、少数のクラスが多数のラベルを受け、大多数のクラスが少数のラベルを受け取っている。
  • 235クラスのポイントラベルを用いて訓練したセグメンテーションモデルが妥当な出力を示し、本手法が密集ラベル付けの代替手段として有効であることが検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。