Skip to main content
QUICK REVIEW

[論文レビュー] Stratified Transformer for 3D Point Cloud Segmentation

Xin Lai, Jianhui Liu|arXiv (Cornell University)|Mar 28, 2022
3D Shape Modeling and Analysis被引用数 9
ひとこと要約

本稿では、近隣の点を密にサンプリングし、遠く離れた点を疎にサンプリングすることで、キーデータとして用いることで、計算コストを最小限に抑えつつ広い有効受容 field を実現する、3次元点群セグメンテーションの新規フレームワーク「Stratified Transformer」を提案する。本手法は、最初のレイヤーでの点埋め込み、文脈的相対位置符号化、メモリ効率の良い実装を統合することで、S3DIS、ScanNetv2、ShapeNetPart で最先端の性能を達成する。

ABSTRACT

3D point cloud segmentation has made tremendous progress in recent years. Most current methods focus on aggregating local features, but fail to directly model long-range dependencies. In this paper, we propose Stratified Transformer that is able to capture long-range contexts and demonstrates strong generalization ability and high performance. Specifically, we first put forward a novel key sampling strategy. For each query point, we sample nearby points densely and distant points sparsely as its keys in a stratified way, which enables the model to enlarge the effective receptive field and enjoy long-range contexts at a low computational cost. Also, to combat the challenges posed by irregular point arrangements, we propose first-layer point embedding to aggregate local information, which facilitates convergence and boosts performance. Besides, we adopt contextual relative position encoding to adaptively capture position information. Finally, a memory-efficient implementation is introduced to overcome the issue of varying point numbers in each window. Extensive experiments demonstrate the effectiveness and superiority of our method on S3DIS, ScanNetv2 and ShapeNetPart datasets. Code is available at https://github.com/dvlab-research/Stratified-Transformer.

研究の動機と目的

  • 既存の3次元点群セグメンテーション手法が、局所的特徴集約に依存しているため、長距離の依存関係をモデル化する能力に制限があることに対処すること。
  • 計算コストや位置の正確性を損なわず、3次元Transformerにおける効率的な長距離アテンションを可能にすること。
  • 不規則な3次元点群データ(点数が変動する)に特化した、強固で一般化可能なTransformerアーキテクチャを設計すること。
  • 3次元点群処理における不規則な空間配置や変動するウィンドウサイズの課題を克服すること。

提案手法

  • 階層的キーサンプリング戦略を導入:各クエリ点に対して、近隣の点を密にサンプリングし、遠く離れた点を疎にサンプリングしてキーデータとする。これにより、有効受容 field を拡大する。
  • 最初のレイヤーでの点埋め込みを採用し、局所的特徴を集約することで、学習中の収束性と性能を向上させる。
  • 空間座標と意味的特徴の両方を用いて、動的に位置バイアスをモデル化する文脈的相対位置符号化(cRPE)を適用する。
  • メモリ効率の良い実装により、点数が少ないウィンドウでのメモリ消費量を削減し、点数の変動に適応する。
  • シフトされたウィンドウ戦略を採用し、ウィンドウ間の情報フローを強化することで、特徴表現を向上させる。
  • 標準的なマルチヘッド自己アテンションを採用し、キーサンプリングを変更することで、位置の整合性を維持しながら長距離モデリングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1計算コストを低く抑えながら、3次元点群セグメンテーションにおける長距離依存関係を効果的にモデル化できるか?
  • RQ2Transformerベースの3次元セグメンテーションフレームワークにおいて、不規則な点配置を効果的に処理できるか?
  • RQ3標準的なマルチヘッド自己アテンションを、強力な一般化性能と性能を維持したまま3次元点群に適応できるか?
  • RQ4文脈的相対位置符号化(cRPE)は、3次元Transformerの性能向上にどのような役割を果たすか?
  • RQ5提案された階層的キーサンプリング戦略は、従来の局所的またはグローバルアテンションと比較して、効率性と正確性の面で優れているか?

主な発見

  • Stratified Transformer は、S3DIS データセットで72.0%のmIoUを達成し、従来手法を上回る。
  • ScanNetv2 では72.0%のmIoUを達成し、多様な実世界シーンへの強い一般化能力を示している。
  • ShapeNetPart では89.2%のmIoUを達成し、部品レベルのセグメンテーションにおいて優れた性能を示している。
  • アブレーションスタディの結果、cRPEをクエリ、キー、値の特徴に適用した場合が最良の性能を示し、全データオーグメンテーションを用いることで5.9%のmIoU向上が確認された。
  • モデルは非常に頑健であり、回転、スケーリング、ジャッタなどのさまざまな摂動に対しても高い性能を維持しており、z軸90°回転下でも72.02%のmIoUを達成した。
  • メモリ効率の良い実装により、特に点数が少ないウィンドウでメモリ消費量が顕著に削減されたが、性能に影響を与えないままだった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。