Skip to main content
QUICK REVIEW

[論文レビュー] SE(3)-Equivariant Attention Networks for Shape Reconstruction in Function Space

Evangelos Chatzipantazis, Stefanos Pertigkiozoglou|arXiv (Cornell University)|Apr 5, 2022
3D Shape Modeling and Analysis被引用数 7
ひとこと要約

本稿では、局所的な等長的注意メカニズムを活用することで、方向が不定でスパarsなノイズの多い点群から3次元形状を再構築する、新しいSE(3)同変な座標ベースの注意ネットワーク、TF-ONetを提案する。トレーニング中に事前セグメンテーションやポーズアライメントを必要とせず、任意の物体配置を持つ新規シーンへも頑健に一般化でき、単一物体および複数物体シーン再構築において最先端の性能を達成する。

ABSTRACT

We propose a method for 3D shape reconstruction from unoriented point clouds. Our method consists of a novel SE(3)-equivariant coordinate-based network (TF-ONet), that parametrizes the occupancy field of the shape and respects the inherent symmetries of the problem. In contrast to previous shape reconstruction methods that align the input to a regular grid, we operate directly on the irregular point cloud. Our architecture leverages equivariant attention layers that operate on local tokens. This mechanism enables local shape modelling, a crucial property for scalability to large scenes. Given an unoriented, sparse, noisy point cloud as input, we produce equivariant features for each point. These serve as keys and values for the subsequent equivariant cross-attention blocks that parametrize the occupancy field. By querying an arbitrary point in space, we predict its occupancy score. We show that our method outperforms previous SO(3)-equivariant methods, as well as non-equivariant methods trained on SO(3)-augmented datasets. More importantly, local modelling together with SE(3)-equivariance create an ideal setting for SE(3) scene reconstruction. We show that by training only on single, aligned objects and without any pre-segmentation, we can reconstruct novel scenes containing arbitrarily many objects in random poses without any performance loss.

研究の動機と目的

  • 方向が不定でスパarsでノイズの多い点群からの3次元形状再構築の課題、特に任意のポーズにある複数の物体を含む複雑なシーンにおいて解決する。
  • 回転および平行移動の下で幾何的対称性を保つために、SE(3)同変性を帰納的バイアスとして組み込む。
  • 大規模で非構造的なシーンに効率的にスケーリング可能な、局所的な形状モデリングを可能にする同変注意層を実装する。
  • トレーニング時に単一の標準的な物体にのみアクセスしている場合でも、ランダムなポーズにある複数の物体を含む新規シーンを高精度に再構築することを可能にする。
  • スカラーおよびベクトル表現を越えて、注意メカニズム内で高次元テンソル場表現を活用する。

提案手法

  • 本手法は二段階のアーキテクチャを採用する:点群の近傍から同変特徴を抽出する局所自己注意エンコーダと、空間内のクエリポイントにおける占有スコアを予測するクロス注意オカパシティネットワーク。
  • 同変注意層はテンソル場フレームワークに基づき、局所的なトークン上で動作し、スカラーおよびベクトルを越えた高次元表現を可能にするとともに、SE(3)変換に対して不変性を保証する。
  • ポイント特徴がキーおよびバリューとして機能し、クエリの空間座標がクエリとして使用され、占有スコアが予測される。
  • モデルは、標準的でアライメント済みの単一物体上でエンドツーエンドにトレーニングされ、再訓練やセグメンテーションなしに、任意の数の物体がランダムなポーズで配置されたシーンへ一般化可能である。
  • 同変性は、特定の幾何的領域(同変ゾーン)において形式的に確立されており、点群が独立してSO(3)回転された場合でも、クエリの最近接近点が一貫している。
  • グリッドベースの表現を避けており、不規則な点群上で直接動作するため、スケーラビリティとトポロジーに依存しない再構築を維持する。

実験結果

リサーチクエスチョン

  • RQ1SE(3)同変な注意を備えた座標ベースのネットワークは、非同変およびSO(3)同変なベースラインと比較して、方向が不定でスパarsでノイズの多い点群からの3次元形状再構築において優れた性能を達成できるか?
  • RQ2同変特徴学習を伴う局所的注意は、単一の標準的物体にのみトレーニングされた場合でも、任意のポーズにある複数の物体を含む新規シーンへの一般化を可能にするか?
  • RQ3スカラーおよびベクトルを越えた高次元テンソル表現は、同変形状再構築の性能向上にどの程度寄与するか?
  • RQ4明示的なセグメンテーションやポーズの教師信号なしに、複雑なシーンレベルの変換に対しても同変性を維持できるか?
  • RQ5本モデルの性能は、未観測の物体クラスや構成を含む多様なシーン構成において、どのようにスケーリングされるか?

主な発見

  • TF-ONetは、Vector Neurons や GraphOnet などのSO(3)同変な手法に加え、SO(3)データオーグメンテーションを用いてトレーニングされた非同変モデルよりも、単一物体および複数物体再構築ベンチマークで優れた性能を示した。
  • Seismicデータセットにおいても、ランダムに配置された物体を含むシーンで、再構築品質の面で顕著な性能差を示し、最先端の定量的結果を達成した。
  • Matterport3Dにおける定性的な評価では、微調整やセグメンテーションなしに、未観測の物体クラスを含む実世界のシーンへ一般化し、高精度な再構築を実現した。
  • 定義された同変ゾーンにおいて、モデルは同変性を維持しており、点群が独立してSO(3)回転された場合でも、クエリの最近接点が一貫している。
  • 任意の数の物体がランダムなポーズで配置された新規シーンへも、単一でアライメント済みの物体にのみトレーニングされた場合でも、性能劣化なしに高品質な再構築を達成した。
  • テンソル場フレームワークによる高次元テンソル表現の活用により、スカラーおよびベクトルのみのアプローチよりも表現力の高い特徴学習が可能となり、性能向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。