Skip to main content
QUICK REVIEW

[論文レビュー] Spatial-Temporal Transformer for 3D Point Cloud Sequences

Yimin Wei, Hao Liu|arXiv (Cornell University)|Oct 19, 2021
3D Shape Modeling and Analysis参考文献 40被引用数 4
ひとこと要約

本稿では、3次元点群シーケンス向けに空間的・時間的自己注意(STSA)モジュールを用いてフレーム間の文脈をモデル化するとともに、特徴抽出過程での空間的解像度の損失を回復するための解像度埋め込み(RE)モジュールを組み合わせた空間的・時間的変換器PST²を提案する。PST²は、4Dセマンティックセグメンテーションおよび3次元アクション認識のベンチマークで最先端の性能を達成し、SemanticKITTIではmIoUが最大3.2%向上、MSR-Action3Dでは5.39%の精度向上を達成した。

ABSTRACT

Effective learning of spatial-temporal information within a point cloud sequence is highly important for many down-stream tasks such as 4D semantic segmentation and 3D action recognition. In this paper, we propose a novel framework named Point Spatial-Temporal Transformer (PST2) to learn spatial-temporal representations from dynamic 3D point cloud sequences. Our PST2 consists of two major modules: a Spatio-Temporal Self-Attention (STSA) module and a Resolution Embedding (RE) module. Our STSA module is introduced to capture the spatial-temporal context information across adjacent frames, while the RE module is proposed to aggregate features across neighbors to enhance the resolution of feature maps. We test the effectiveness our PST2 with two different tasks on point cloud sequences, i.e., 4D semantic segmentation and 3D action recognition. Extensive experiments on three benchmarks show that our PST2 outperforms existing methods on all datasets. The effectiveness of our STSA and RE modules have also been justified with ablation experiments.

研究の動機と目的

  • 4Dセマンティックセグメンテーションや3次元アクション認識などのタスクを対象として、スパarsityで無順序な3次元点群シーケンスにおける空間的・時間的ダイナミクスをモデル化する課題に対処すること。
  • 過去のすべてのフレームを対象とする再帰的または完全履歴自己注意機構に依存する従来のフレーム間特徴統合手法における情報の重複を軽減すること。
  • エンコーダ・デコーダアーキテクチャにおける解像度損失を軽減するため、近隣特徴の集約を用いて特徴マップの解像度を向上させる。
  • 既存の静的点群ネットワークに対してアーキテクチャの大規模な見直しを施さずに性能を向上させる、即挿し可能なモジュールの設計。

提案手法

  • 自己注意を用いて隣接フレーム間の特徴を適応的に統合する空間的・時間的自己注意(STSA)モジュールを導入し、RNN や完全履歴自己注意と比較して冗長性を低減する。
  • 学習された自己注意重みを用いて近隣間の特徴を集約することで、特徴の解像度を向上させる解像度埋め込み(RE)モジュールを設計する。
  • 2段階のフレームワークにSTSAおよびREを統合する:まずセットアブストラクションにより特徴抽出を行い、その後、空間的・時間的パッチの形成とSTSAによる文脈モデリングを実施する。
  • 3次元アクション認識のためのMeteorNetにSTSAモジュールを適用し、点ベースフレームワークにおける時間的モデリングを可能にする。
  • 訓練の安定性と耐障害性を向上させるために、STSAに残差接続とレイヤーナーミャライゼーションを適用する。
  • 初期の特徴抽出およびシードポイント選択のため、ポイントワイドなMLPと最も遠い点サンプリング(FPS)を活用する。

実験結果

リサーチクエスチョン

  • RQ1自己注意機構は、過去のフレーム統合に起因する冗長性を低減しつつ、動的3次元点群シーケンスにおける空間的・時間的文脈を効果的にモデル化できるか?
  • RQ2近隣特徴の集約による解像度回復は、点群シーケンスにおけるセグメンテーション精度をどの程度向上できるか?
  • RQ3PST²フレームワークは、4Dセマンティックセグメンテーションおよび3次元アクション認識のベンチマークにおいて、最先端手法と比較してどの程度の性能を示すか?
  • RQ4アブレーションスタディにより、STSAおよびREモジュールの個々の寄与度はどの程度か?

主な発見

  • SemanticKITTIデータセットにおいて、PST²はPointNet++(PNv2)に対して16.4%のmIoU向上を達成し、顕著な性能向上を示した。
  • SemanticKITTIにおいて、PST²は最先端のASAP-Netを3.2%のmIoU向上で上回り、19のカテゴリのうち15で性能向上を達成した。
  • 解像度埋め込み(RE)モジュールは、SemanticKITTIで4.1%のmIoU向上をもたらし、特に地形カテゴリで最大38.9%の向上を示した。
  • STSAモジュールはPNv2に対して12.3%のmIoU向上を達成し、地形カテゴリで最大36.5%、車両カテゴリで29.7%の向上を示した。
  • MSR-Action3Dにおいて、PST²は8フレーム入力で5.39%の精度向上を達成し、16フレームでは89.22%のmAccを達成し、MeteorNetを上回った。
  • アブレーションスタディにより、STSAおよびREモジュールはいずれもすべてのカテゴリで性能向上を示したことが確認され、特に複雑またはスパarsityの高いクラス(地形、オートバイ乗り手など)で最大の向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。