Skip to main content
QUICK REVIEW

[論文レビュー] One Thing One Click: A Self-Training Approach for Weakly Supervised 3D Semantic Segmentation

Zhengzhe Liu, Xiaojuan Qi|arXiv (Cornell University)|Apr 6, 2021
3D Shape Modeling and Analysis参考文献 55被引用数 12
ひとこと要約

本論文は、1オブジェクトあたり1点のラベルのみを要する「ワン・スモール・ワン・クリック」—「One Thing One Click」—を採用した自己学習フレームワークを提案する。これにより、完全教師あり手法と同等の性能を、わずか0.02%のアノテーションで達成している。関係ネットワークを用いたグラフ伝播モジュールとメモリーバンクを活用し、反復的に偽ラベルを精緻化することで、アノテーションコストを著しく削減しながら、ScanNet-v2およびS3DISで高い精度を維持している。

ABSTRACT

Point cloud semantic segmentation often requires largescale annotated training data, but clearly, point-wise labels are too tedious to prepare. While some recent methods propose to train a 3D network with small percentages of point labels, we take the approach to an extreme and propose "One Thing One Click," meaning that the annotator only needs to label one point per object. To leverage these extremely sparse labels in network training, we design a novel self-training approach, in which we iteratively conduct the training and label propagation, facilitated by a graph propagation module. Also, we adopt a relation network to generate per-category prototype and explicitly model the similarity among graph nodes to generate pseudo labels to guide the iterative training. Experimental results on both ScanNet-v2 and S3DIS show that our self-training approach, with extremely-sparse annotations, outperforms all existing weakly supervised methods for 3D semantic segmentation by a large margin, and our results are also comparable to those of the fully supervised counterparts.

研究の動機と目的

  • 3次元セマンティックセグメンテーションにおけるアノテーション負荷を著しく低減することを目的とし、1オブジェクトあたり1点のラベルのみを要する。
  • 極めて疎で弱教師ありのアノテーションから、頑健なモデルを学習する課題に取り組む。
  • グラフベースのラベル伝播を通じて反復的に偽ラベルの品質を向上させる自己学習フレームワークを開発すること。
  • 最小限の人的努力で高精度な3次元セグメンテーションを実現し、完全教師あり手法に近い性能を達成すること。

提案手法

  • 本手法は、1オブジェクトあたり1点のラベルのみを指定する「ワン・スモール・ワン・クリック」アノテーション方式を採用し、1スキャンあたりのアノテーション時間を2分未満にまで短縮している。
  • 初期のセマンティック予測には3D U-Netバックボーンを用い、その後、偽ラベルの精緻化を伴う反復的自己学習を実施する。
  • スーパーボクセルに基づくグラフ伝播モジュールが、学習されたノード類似度を用いて、点群全体にわたって偽ラベルを伝播させる。
  • 関係ネットワークが3次元特徴を用いてスーパーボクセル間の高レベルな幾何的類似度を学習し、手作業で設計された特徴(座標や色など)を上回るラベル伝播の正確性を実現する。
  • メモリーバンクがカテゴリごとのプロトタイプを保持し、とくにレアクラスや低頻度クラスにおいて類似度学習の安定性を高める。
  • フレームワークは訓練時および推論時において、グラフ伝播と関係ネットワークを統合し、偽ラベルのエンドツーエンド精緻化を可能にする。

実験結果

リサーチクエスチョン

  • RQ11オブジェクトあたり1点のラベルのみを用いて、3次元セマンティックセグメンテーションが完全教師ありに近い性能を達成できるか?
  • RQ2極めて弱い監視と高い幾何的複雑性を伴う3次元点群において、偽ラベルを効果的に伝播させる方法は何か?
  • RQ3関係ネットワークは、座標や色といった手作業特徴を上回る3次元スーパーボクセル間の類似度学習を改善できるか?
  • RQ4メモリーバンクは、弱教師あり3次元セグメンテーションにおける希少カテゴリのプロトタイプ学習を安定化させる役割を果たすか?
  • RQ5グラフ伝播を用いた反復的自己学習は、より高いアノテーション予算を持つ既存の弱教師あり手法を著しく上回るか?

主な発見

  • 提案手法は、ScanNet-v2の検証セットでmIoU 70.45を達成し、0.02%の点アノテーションのみを用いても、既存のあらゆる弱教師あり手法を上回っている。
  • 1オブジェクトあたり1点のラベルのみを用いても、従来の弱教師ありアプローチを大きく上回っており、はるかに多くのアノテーションを要する手法に対しても優位性を示している。
  • アブレーションスタディにより、自己学習、グラフ伝播、関係ネットワーク、メモリーバンクの各モジュールが性能向上に寄与していることが確認され、フルモデルが最高のmIoUを達成している。
  • レアクラスのプロトタイプを安定化させる観点で、メモリーバンクは極めて重要であり、これを削除すると関係ネットワークを用いない場合と同程度の性能低下が生じる。
  • 完全教師ありベースラインと同等の結果を達成しており、効果的な自己学習と組み合わせることで、極めて高いアノテーション効率であってもモデルの一般化性能が損なわれないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。