Skip to main content
QUICK REVIEW

[論文レビュー] SymmetryNet: Learning to Predict Reflectional and Rotational Symmetries of 3D Shapes from Single-View RGB-D Images

Yifei Shi, Junwen Huang|arXiv (Cornell University)|Aug 2, 2020
Optical measurement and interference techniques参考文献 53被引用数 10
ひとこと要約

SymmetryNetは、1枚のRGB-D画像から3次元形状の反転対称性と回転対称性を同時に予測するエンドツーエンドの深層学習フレームワークを提案する。マルチタスク学習を用いて、対称軸と対称点対応を同時に予測することで、欠損データや複数の対称性、遮蔽状況下でも高い精度と一般化性能を達成する。これは、相補的な点対応予測のための統一された監督信号と、可視性を考慮した集約手法を活用することで実現される。

ABSTRACT

We study the problem of symmetry detection of 3D shapes from single-view RGB-D images, where severely missing data renders geometric detection approach infeasible. We propose an end-to-end deep neural network which is able to predict both reflectional and rotational symmetries of 3D objects present in the input RGB-D image. Directly training a deep model for symmetry prediction, however, can quickly run into the issue of overfitting. We adopt a multi-task learning approach. Aside from symmetry axis prediction, our network is also trained to predict symmetry correspondences. In particular, given the 3D points present in the RGB-D image, our network outputs for each 3D point its symmetric counterpart corresponding to a specific predicted symmetry. In addition, our network is able to detect for a given shape multiple symmetries of different types. We also contribute a benchmark of 3D symmetry detection based on single-view RGB-D images. Extensive evaluation on the benchmark demonstrates the strong generalization ability of our method, in terms of high accuracy of both symmetry axis prediction and counterpart estimation. In particular, our method is robust in handling unseen object instances with large variation in shape, multi-symmetry composition, as well as novel object categories.

研究の動機と目的

  • 部分的に観測され、遮蔽されている3次元形状の対称性を1枚のRGB-D画像から検出する課題に取り組む。幾何的手法では欠損データのため失敗する。
  • 多様なオブジェクトカテゴリ、形状の変異、複数対称性の組み合わせに対しても一般化できるデータ駆動型の深層学習手法を開発する。
  • 対称軸予測と対称点対応推定の両方を同時に学習することで、対称性検出のロバスト性を向上させる。
  • 標準化された評価を可能にするために、1枚のRGB-D画像からの対称性検出のベンチマークデータセットを構築する。
  • 6次元オブジェクトポーズ推定や対称性を考慮したRGB-Dセグメンテーションなどの下流応用を可能にする。

提案手法

  • ネットワークはRGB画像と深度画像を入力とし、共有バックボーンを用いて点毎の外観特徴と幾何的特徴を抽出する。
  • マルチタスク学習により、点群内の各3次元点に対して、反転対称軸と回転対称軸を同時に予測する。
  • 対応点予測のため、各点が対称的対応点である確率を示すヒートマップと、直接的にその3次元座標を回帰する。
  • 真値の対応点位置に基づく統一された監督信号を用いて、2つのタスクを相関させ、過学習を低減する。
  • 最適な割り当てモジュールにより、複数の候補から最良の対称性のセットを選択し、任意の数の混合タイプの対称性を検出可能にする。
  • 可視性に基づく検証を適用し、遮蔽や視野制約に基づいて無効な予測をフィルタリングする。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、欠損データがある1枚のRGB-D画像から、3次元形状の反転対称性と回転対称性を効果的に検出できるか?
  • RQ2対応点予測を含むマルチタスク学習は、対称性検出における一般化性能の向上と過学習の低減にどのように寄与するか?
  • RQ3同じオブジェクト内で、遮蔽されている場合でも、異なるタイプの複数の対称性(例:反転と回転)を検出できるか?
  • RQ4本モデルは、学習データに含まれない新しいオブジェクトカテゴリや未観測の形状変異に対しても、どのように性能を示すか?
  • RQ5対称性予測は、6次元オブジェクトポーズ推定やRGB-Dセグメンテーションといった下流タスクに、どの程度向上効果をもたらすか?

主な発見

  • 本手法は、形状の大きな変異や部分的観測がある場合でも、対称軸予測と対応点推定において高い精度を達成する。
  • SymmetryNetは、未学習のオブジェクトカテゴリや新しいインスタンスに対しても良好に一般化され、実世界および合成シナリオの両方で強いロバスト性を示す。
  • 対称軸予測と対応点予測の両方を同時に学習するマルチタスク学習アーキテクチャは、直接的な対称性予測と比較して、著しく過学習を低減する。
  • SymmetryNetの対称性予測の統合により、DenseFusionにおける6次元オブジェクトポーズ推定性能が向上し、実応用における実用性が確認された。
  • 学習時にセグメンテーションラベルを用いずに、点毎の対称性ラベルを入力画像に投影することで、対称性誘導型のRGB-Dセグメンテーションを実現できる。
  • 定性的な比較では、幾何的フィッティング、RGB-Dリtrieval、PRS-Net、形状補完ベースラインと比較して、特に複雑な形状や遮蔽状態の下でもSymmetryNetが優れた性能を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。