Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Orient Surfaces by Self-supervised Spherical CNNs

Riccardo Spezialetti, Federico Stella|arXiv (Cornell University)|Nov 6, 2020
3D Shape Modeling and Analysis参考文献 6被引用数 9
ひとこと要約

本稿では、球面畳み込みニューラルネットワーク(spherical CNNs)を用い、3次元回転に対して不変性を示す内在的性質を持つことで、点群表面の標準的な3次元方位を自己教師付きで学習する Compass を提案する。回転不変なデータ拡張を用いて生データで訓練することで、入力形状を一貫した標準フレームに整列する回転を予測する。この手法により、回転不変な形状分類および頑健な局所基準フレーム推定において、最先端の性能を達成した。

ABSTRACT

Defining and reliably finding a canonical orientation for 3D surfaces is key to many Computer Vision and Robotics applications. This task is commonly addressed by handcrafted algorithms exploiting geometric cues deemed as distinctive and robust by the designer. Yet, one might conjecture that humans learn the notion of the inherent orientation of 3D objects from experience and that machines may do so alike. In this work, we show the feasibility of learning a robust canonical orientation for surfaces represented as point clouds. Based on the observation that the quintessential property of a canonical orientation is equivariance to 3D rotations, we propose to employ Spherical CNNs, a recently introduced machinery that can learn equivariant representations defined on the Special Orthogonal group SO(3). Specifically, spherical correlations compute feature maps whose elements define 3D rotations. Our method learns such feature maps from raw data by a self-supervised training procedure and robustly selects a rotation to transform the input point cloud into a learned canonical orientation. Thereby, we realize the first end-to-end learning approach to define and extract the canonical orientation of 3D shapes, which we aptly dub Compass. Experiments on several public datasets prove its effectiveness at orienting local surface patches as well as whole objects.

研究の動機と目的

  • 3次元表面のエンドツーエンドで学習可能な標準的方位推定の欠如に取り組むこと。現在の手法は、手作業で設計された幾何的ヒューリスティクスに依存している。
  • 深層学習が、事前に定義された幾何的ルールに依存せず、経験を通じて人間と同様の標準的方位を習得できるかを検証すること。
  • 未観測の回転や実世界のノイズおよび遮蔽を扱える、頑健な自己教師付きフレームワークを構築すること。
  • 球面畳み込みニューラルネットワークを用いて、データ駆動型の標準フレームを学習することで、3次元ビジョンタスクにおける回転不変処理を可能にすること。
  • SO(3)に等長性を示す深層学習が、従来の回転不変または回転等長性ネットワークを越えて、表面の方位推定に応用可能かどうかを示すこと。

提案手法

  • 回転群 SO(3) 上で動作する球面畳み込みニューラルネットワーク(spherical CNNs)を活用し、特徴マップの座標が3次元回転を表すように学習させる。このネットワークは、3次元回転に対して等長性を有するように設計されている。
  • センサーノイズや遮蔽を模倣するデータ拡張を用いた自己教師付き学習目的関数を採用し、ランダムな回転と部分点群のマスキングを含む。
  • 球面特徴マップの argmax を予測された標準的回転とし、これにより入力点群を標準的方位に変換する。
  • 回転および遮蔽操作を逆伝播可能にする微分可能なデータ拡張パイプラインを導入し、エンドツーエンドの学習を可能にする。
  • 下流タスク(形状分類や局所基準フレーム推定など)において、学習された方位を用いて回転変動を中和する。
  • 2段階の訓練プロトコルを採用:まず、Compass は生点群上でエンドツーエンドで標準的方位を学習する。次に、その方位を用いてデータを前処理し、PointNet などの標準分類器に供給する。

実験結果

リサーチクエスチョン

  • RQ1回転等長性を活用することで、明示的な教師信号なしに深層ニューラルネットワークが表面の標準的3次元方位を学習できるか?
  • RQ2自己教師付き球面畳み込みニューラルネットワークベースの手法は、回転、ノイズ、部分観測の下でも、一貫性があり頑健な標準的方位推定にどの程度有効か?
  • RQ3深層ネットワークによる標準的方位の学習が、局所的表面パッチの方位推定やグローバル形状分類において、手作業で設計された幾何的手法を上回るか?
  • RQ4本手法は、異なるデータセットやオブジェクトカテゴリにわたってどの程度一般化できるか、特に1つのデータセットで学習し、別のデータセットでテストした場合の性能は?
  • RQ5SO(3)に等長性を示すネットワークの使用は、標準的な回転不変またはデータ拡張モデルと比較して、未観測の回転への一般化性能を向上させるか?

主な発見

  • Compass を用いて PointNet 入力の前処理を施した場合、ModelNet40 の回転テストセットで 72.20% の精度を達成し、任意の回転下で失敗するベースライン手法を著しく上回った。
  • データ拡張なしで学習した場合、PointNet の精度は回転テストデータで 12.47% に低下するが、Compass + PointNet では 72.20% まで回復し、学習された標準的方位の有効性を示した。
  • 未観測のデータセットにも良好に一般化される:ModelNet40 で学習したモデルは、幾何的変化があるにもかかわらず、ShapeNet データセットの形状を一貫した標準フレームに整列できた。
  • Compass は局所基準フレーム推定において最先端の性能を達成し、自己遮蔽や部分的視認に対しても頑健であることが示された。
  • 標準的方位設定(NR)では、Compass + PointNet は通常の PointNet(80.51% 対 89.82%)を下回る性能を示した。これは、Compass が回転変動が存在する場合にのみ価値を提供することを確認した。
  • 定性的な結果から、Compass は、形状の多様性が著しいオブジェクトクラスに対しても一貫した標準的方位を生成しており、強力な一般化性と不変性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。