Skip to main content
QUICK REVIEW

[論文レビュー] 3D Siamese Transformer Network for Single Object Tracking on Point Clouds

Le Hui, Lingpeng Wang|arXiv (Cornell University)|Jul 25, 2022
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

本稿では、自己注意機構をエンコーダ・デコーダアーキテクチャに統合し、形状コンテキストを学習するとともに、相関学習のためのクロス注意を用いる3次元シアンズ型トランスフォーマーであるSTNetを提案する。エゴ特徴とクロス特徴の増強を用いた粗〜細の相関を繰り返し適用することで、エゴ特徴とクロス特徴の特徴統合を段階的に最適化し、KITTI、nuScenes、Waymoベンチマークで最先端の性能を達成する。

ABSTRACT

Siamese network based trackers formulate 3D single object tracking as cross-correlation learning between point features of a template and a search area. Due to the large appearance variation between the template and search area during tracking, how to learn the robust cross correlation between them for identifying the potential target in the search area is still a challenging problem. In this paper, we explicitly use Transformer to form a 3D Siamese Transformer network for learning robust cross correlation between the template and the search area of point clouds. Specifically, we develop a Siamese point Transformer network to learn shape context information of the target. Its encoder uses self-attention to capture non-local information of point clouds to characterize the shape information of the object, and the decoder utilizes cross-attention to upsample discriminative point features. After that, we develop an iterative coarse-to-fine correlation network to learn the robust cross correlation between the template and the search area. It formulates the cross-feature augmentation to associate the template with the potential target in the search area via cross attention. To further enhance the potential target, it employs the ego-feature augmentation that applies self-attention to the local k-NN graph of the feature space to aggregate target features. Experiments on the KITTI, nuScenes, and Waymo datasets show that our method achieves state-of-the-art performance on the 3D single object tracking task.

研究の動機と目的

  • スパarsely、不規則に分布した点群におけるテンプレート領域とサーチ領域間の顕著な外観変動の課題に対処すること。
  • シアンズ型トランスフォーマーのエンコーダ・デコーダ構造を用いて、長距離の形状コンテキストを捉えることで特徴表現を向上させること。
  • 繰り返し適用される粗〜細の特徴統合により、テンプレート領域とサーチ領域間の相関学習を強化すること。
  • 局所的なk-NNグラフにおける特徴空間での自己注意を適用することで、類似した意味的特徴を集約し、ターゲット表現を強化する(エゴ特徴増強)。
  • エンド・トゥ・エンドの注意ベースのフレームワークを用いて、標準的な3次元追跡ベンチマークで最先端の追跡性能を達成すること。

提案手法

  • エンコーダで自己注意を用いて、点群からの非局所的形状コンテキストを捉える3次元シアンズ型トランスフォーマーネットワーク(エンコーダ・デコーダ構造)。
  • デコーダは、学習可能な注意重みを用いた適応的特徴補間を採用し、低スケールの点群から元の解像度に特徴をアップサンプリングする。
  • 繰り返し適用される粗〜細の相関ネットワークは、クロス注意を用いてテンプレート領域とサーチ領域の特徴を統合し、粗い局所化を可能にする。
  • エゴ特徴増強は、特徴空間内の局所的k-NNグラフに自己注意を適用し、意味的に類似した特徴を集約することでターゲット表現を強化する。
  • 注意マップがターゲット局所化をガイドするエンド・トゥ・エンドの学習により、特徴学習と相関学習を同時に最適化する。
  • 最適なパフォーマンスとメモリ効率を達成するため、k-NNサイズ(K)や反復回数などのハイパーパrameterを調整する。

実験結果

リサーチクエスチョン

  • RQ1自己注意機構は、スパースな3次元点群における長距離の形状コンテキストを効果的にモデル化できるか?
  • RQ2クロス注意とエゴ注意を組み合わせた繰り返し的粗〜細の相関が、外観変動に対する追跡のロバストネスをどのように向上させるか?
  • RQ33次元追跡において、局所的特徴集約(k-NNを介して)とグローバルな注意の間で最適なバランスは何か?
  • RQ4提案手法のシアンズ型トランスフォーマーは、既存の2次元および3次元シアンズベースラインと比較して、精度と推論効率の両面で優れているか?
  • RQ5注意を用いた形状コンテキスト学習は、実世界の3次元データセットにおける追跡性能をどの程度向上させるか?

主な発見

  • 提案手法のSTNetは、KITTI、nuScenes、Waymoデータセットで最先端の性能を達成し、スカスセスレート72.1%、プレシジョン84.0%を達成した。
  • アブレーションスタディの結果、非局所埋め込みと適応的特徴補間の組み合わせにより、スカスセスレートがPointNet++の66.1%から72.1%に向上した。
  • クロス特徴増強(CF aug.)とエゴ特徴増強(EF aug.)の両方を適用した場合が最良の結果を示し、単一モジュールのベースラインを上回った。
  • エゴ特徴増強における最適なk-NNサイズはK=48であり、局所構造の捉え方と背景ノイズの抑制のバランスが取れている。
  • 粗〜細の相関ネットワークにおける最適な反復回数は2回であり、性能とGPUメモリ使用量のトレードオフにおいて最良のバランスを示した。
  • 可視化結果から、すべてのモジュールを統合したSTNetはターゲットを的確に注目しているのに対し、部分的なモデルでは車両と背景の区別がつかないことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。