Skip to main content
QUICK REVIEW

[論文レビュー] ReDAL: Region-based and Diversity-aware Active Learning for Point Cloud Semantic Segmentation

Tsung-Han Wu, Yueh-Cheng Liu|arXiv (Cornell University)|Jul 25, 2021
3D Shape Modeling and Analysis参考文献 30被引用数 4
ひとこと要約

ReDAL は、点群のセマンティックセグメンテーションのための領域ベースで多様性に配慮したアクティブラーニングフレームワークであり、注釈に必要な情報を有する多様なサブシーン領域のみを選択することで、ラベル付けコストを削減する。ソフトマックスエントロピー、色の不連続性、構造的複雑さを組み合わせて領域をスコア化し、グリーディな多様性に配慮した選択を実施することで、S3DIS では15%未塔のラベルで、SemanticKITTI では5%未塔のラベルで完全教師あり学習性能の90%を達成する。

ABSTRACT

Despite the success of deep learning on supervised point cloud semantic segmentation, obtaining large-scale point-by-point manual annotations is still a significant challenge. To reduce the huge annotation burden, we propose a Region-based and Diversity-aware Active Learning (ReDAL), a general framework for many deep learning approaches, aiming to automatically select only informative and diverse sub-scene regions for label acquisition. Observing that only a small portion of annotated regions are sufficient for 3D scene understanding with deep learning, we use softmax entropy, color discontinuity, and structural complexity to measure the information of sub-scene regions. A diversity-aware selection algorithm is also developed to avoid redundant annotations resulting from selecting informative but similar regions in a querying batch. Extensive experiments show that our method highly outperforms previous active learning strategies, and we achieve the performance of 90% fully supervised learning, while less than 15% and 5% annotations are required on S3DIS and SemanticKITTI datasets, respectively. Our code is publicly available at https://github.com/tsunghan-wu/ReDAL.

研究の動機と目的

  • 大規模な点群セマンティックセグメンテーションにおける高コストなラベル付けを、最も情報量の多い領域に限定することで削減すること。
  • モデル性能にほとんど寄与しない壁や床のような繰り返しや均一な領域のラベル付けの非効率性を解消すること。
  • さまざまなディーブラーニングアーキテクチャに対応可能な汎用的なアクティブラーニングフレームワークの開発。
  • 小さな複雑な物体やレアな物体(例:人、いす)を優先することで、ラベルの不均衡を軽減すること。
  • 学習済み埋め込み空間における特徴レベルの類似度を測定し、視覚的に類似した領域の重複クエリを避ける多様性に配慮した選択機構により、アクティブラーニングの効率を向上させること。

提案手法

  • モデルの不確実性を測定し、予測が曖昧な領域を特定するためにソフトマックスエントロピーを用いる。
  • 視覚的・幾何的変動が大きい領域(学習に有用な領域)を特定するために、色の不連続性と構造的複雑さを補助信号として用いる。
  • クラスタリングに基づく手法を用いて点群から領域を抽出し、エントロピー、色の不連続性、構造的複雑さの重み付き組み合わせにより各領域をスコア化する。
  • 学習済み埋め込み空間における特徴レベルの類似度を測定し、クエリバッチ内の類似領域にペナルティを課すことで、多様性に配慮したグリーディな選択アルゴリズムを適用する。
  • 反復的に処理する:領域を選択 → ラベルを取得 → モデルを微調整 → さらに繰り返す。性能が飽和するまで繰り返す。
  • SPVCNN や MinkowskiNet などのさまざまな点群ネットワークおよび S3DIS や SemanticKITTI などのデータセットと互換性を持つ。

実験結果

リサーチクエスチョン

  • RQ1完全な点群ではなくサブシーン領域のみを選択することで、3次元セマンティックセグメンテーションにおけるラベル付けコストを著しく削減できるか、かつモデル性能に影響を与えないか?
  • RQ2モデルの不確実性を超えて、視覚的および構造的特徴を用いて領域の情報量を効果的に測定する方法は何か?
  • RQ3視覚的に類似した領域の重複クエリを避ける多様性に配慮した選択機構により、3次元点群環境におけるアクティブラーニングの効率はどの程度向上するか?
  • RQ4領域ベースで多様性に配慮した戦略は、従来のスキャン単位のアクティブラーニングやランダムサンプリングを上回るラベル効率を達成できるか?
  • RQ5提案手法は、ラベルの少ない状況下で、小規模で複雑な物体(例:人、自転車)を優先してラベル付けする仕組みにより、クラスの不均衡をどのように是正できるか?

主な発見

  • S3DIS データセットでは、ReDAL が全ラベルの15%未塔で、完全教師あり学習の平均交差率(mIoU)の90%を達成する。
  • SemanticKITTI データセットでは、ReDAL が全ラベルの5%未塔で、完全教師あり学習と同等の性能を達成する。
  • 同じネットワークアーキテクチャ下で、スキャン単位のアクティブラーニングと比較して、領域ベースの選択戦略により mIoU が10%以上向上する。
  • 多様性に配慮したコンponent により、視覚的に類似した領域の重複ラベリングが防止され、特に SPVCNN ではランダムな領域選択を上回る性能を発揮する。
  • MinkowskiNet では、ラベル点の9%を超えると、色と構造的複雑さの特徴を追加することで性能が向上するが、SPVCNN ではほとんど効果がない。
  • 小さな複雑な物体(例:人、自転車)に多くのラベル予算を割り当てることで、ラベルの不均衡を軽減し、低ラベル予算下でその IoU を最大29.5%向上させる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。