[論文レビュー] Zero-shot point cloud segmentation by transferring geometric primitives
本論文は、既知および未知のカテゴリ間で共有可能な幾何的プリミティブを学習し、言語と照合する細分化された未知対応の対照的損失を用いて、推論的ゼロショット点群セマンティックセグメンテーションのための新規フレームワークを提案する。点特徴を学習可能な幾何的プロトタイプへの類似度ベクトルとしてモデル化し、マルチカーネルセマンティック埋め込みを用いることで、S3DIS、ScanNet、SemanticKITTI、nuScenesでSOTAを更新し、調和平均mIoUを17.8%向上させ30.4%に達する。
We investigate transductive zero-shot point cloud semantic segmentation, where the network is trained on seen objects and able to segment unseen objects. The 3D geometric elements are essential cues to imply a novel 3D object type. However, previous methods neglect the fine-grained relationship between the language and the 3D geometric elements. To this end, we propose a novel framework to learn the geometric primitives shared in seen and unseen categories' objects and employ a fine-grained alignment between language and the learned geometric primitives. Therefore, guided by language, the network recognizes the novel objects represented with geometric primitives. Specifically, we formulate a novel point visual representation, the similarity vector of the point's feature to the learnable prototypes, where the prototypes automatically encode geometric primitives via back-propagation. Besides, we propose a novel Unknown-aware InfoNCE Loss to fine-grained align the visual representation with language. Extensive experiments show that our method significantly outperforms other state-of-the-art methods in the harmonic mean-intersection-over-union (hIoU), with the improvement of 17.8\%, 30.4\%, 9.2\% and 7.9\% on S3DIS, ScanNet, SemanticKITTI and nuScenes datasets, respectively. Codes are available (https://github.com/runnanchen/Zero-Shot-Point-Cloud-Segmentation)
研究の動機と目的
- 教師付き学習データにない未観測のオブジェクトカテゴリを認識できるゼロショット3次元点群セマンティックセグメンテーションの課題に対処する。
- 従来の手法が、言語意味論と3次元幾何的プリミティブの間の細分化された関係をモデル化できないという限界を克服する。
- 推論的ゼロショット学習における既知カテゴリへのバイアスを軽減するため、未知クラスを明示的に扱うInfoNCE損失を導入し、未観測クラスへの一般化を向上させる。
- 既知および未知のカテゴリ間で共有される分離可能な幾何的プリミティブを学習することで、新規オブジェクトのロバストなセグメンテーションを可能にする。
提案手法
- 各点の特徴と学習可能な幾何的プロトタイプとの類似度ベクトルとして、バックプロパゲーションを通じて幾何的プリミティブを暗黙的に符号化する新規な視覚的表現を導入する。
- 複数のカーネルを用いた混合分布埋め込みを用いて言語意味論をモデル化し、3次元オブジェクトが通常複数の幾何的プリミティブから構成されることを反映する。
- 視覚的および意味的表現間の対照的アライメントを実行するとともに、未観測クラスの誤分類を明示的にペナルティ化する未知対応のInfoNCE損失を提案する。
- 推論的設定で学習を行い、未観測カテゴリのラベルなし特徴を訓練中に活用することで、ゼロショット一般化性能を向上させる。
- バックボーンネットワーク(例:PointNet++)を用いて初期点特徴を抽出し、その後にプロトタイプベースの表現学習と対照的アライメントを実行する。
- 既知クラスにおける教師あり損失と、既知および未観測点における提案された未知対応のInfoNCE損失の組み合わせにより、モデルをエンドツーエンドで最適化する。
実験結果
リサーチクエスチョン
- RQ1既知および未観測の3次元オブジェクトカテゴリ間で、効果的に学習され、共有される幾何的プリミティブはどのように実現できるか?
- RQ2言語意味論と幾何的プリミティブの間の細分化されたアライメントは、ゼロショットセグメンテーション性能にどのような影響を与えるか?
- RQ3未観測クラスを明示的に扱う対照的損失は、一般化性能を向上させるとともに、既知カテゴリへのバイアスを低減できるか?
- RQ4複数のカーネルの混合としてモデル化された意味的表現は、複合的な幾何的構造を表す視覚的特徴とどのようにアライメントを改善するか?
主な発見
- 提案手法は、S3DISデータセットにおいて、前回SOTAと比較して17.8%の絶対的向上を達成した。
- ScanNetでは、最も強力なベースラインと比較して、調和平均mIoUが30.4%向上し、複雑な屋内シーンへの強力な一般化を示した。
- SemanticKITTIおよびnuScenesでは、それぞれ9.2%および7.9%のmIoU向上を達成し、多様な3次元認識ベンチマークにおいてもロバストであることを示した。
- アブレーションスタディの結果、幾何的プリミティブに基づく視覚的表現は、ベースライン特徴と比較して未観測mIoUを約5%向上させ、128プロトタイプで最適性能を達成した。
- K=16のマルチカーネル意味的表現が最良の性能を示し、単一カーネルや他のカーネル数と比較して最大7%のmIoU向上を達成した。
- 未知対応のInfoNCE損失は、偽ラベル付けや自己教師あり一貫性損失を大きく上回り、未観測クラスの誤分類を明示的な不確実性モデル化により著しく低減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。