Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Learning of Shape and Pose with Differentiable Point Clouds

Eldar Insafutdinov, Alexey Dosovitskiy|arXiv (Cornell University)|Oct 22, 2018
3D Shape Modeling and Analysis参考文献 23被引用数 17
ひとこと要約

本稿では、再投影誤差と一貫性のあるアンサンブルの知識蒸留を用いて、形状とポーズ予測器を共同最適化することで、教師なしの方法として、1枚の画像から詳細な3D形状とカメラポーズを学習するための微分可能ポイントクラウドを提案する。このモデルは、真値のカメラポーズを必要とせず、高精度な形状再構築を達成し、ボクセルベースのベースラインを上回り、自動的に意味的対応関係を同定できる。

ABSTRACT

We address the problem of learning accurate 3D shape and camera pose from a collection of unlabeled category-specific images. We train a convolutional network to predict both the shape and the pose from a single image by minimizing the reprojection error: given several views of an object, the projections of the predicted shapes to the predicted camera poses should match the provided views. To deal with pose ambiguity, we introduce an ensemble of pose predictors which we then distill to a single "student" model. To allow for efficient learning of high-fidelity shapes, we represent the shapes by point clouds and devise a formulation allowing for differentiable projection of these. Our experiments show that the distilled ensemble of pose predictors learns to estimate the pose accurately, while the point cloud representation allows to predict detailed shape models. The supplementary video can be found at https://www.youtube.com/watch?v=LuIGovKeo60

研究の動機と目的

  • 教師なしの2次元画像から正確な3D形状とカメラポーズを学習し、真値のカメラポーズを必要としないこと。
  • 形状とポーズ推定の「鶏と卵」問題を、両予測器の共同最適化によって克服すること。
  • 多様なアンサンブルのポーズ予測器を訓練し、知識蒸留によって単一の学生モデルに統合することで、ポーズの曖昧さと局所最適解を回避すること。
  • 低解像度のボクセルグリッドの代わりに微分可能なポイントクラウド表現を用いることで、高精度な形状モデリングを実現すること。
  • ポイントクラウド出力の構造から、明示的な教師信号なしに、オブジェクトインスタンス間の意味的対応関係を自動で発見すること。

提案手法

  • ボクセルの代わりにポイントクラウドを3D形状の表現として用いることで、高精度で効率的かつマター中心の形状モデリングを可能にする。
  • 予測されたカメラポーズ下でポイントクラウドから2次元のシルエット、深度マップ、またはカラー画像をレンダリングする微分可能な投影演算子を導入する。
  • 予測された2次元投影と入力画像との再投影誤差を最小化することで、形状とポーズ予測器を共同で最適化する。
  • 局所最適解とポーズの曖昧さを軽減するため、複数のポーズ予測器のアンサンブルを訓練し、その後単一の学生モデルに知識蒸留を行う。
  • 全結合デコーダを用いてポイントクラウドを生成することで、インスタンス間で暗黙的な意味的対応関係を実現する。
  • ポイントクラウド出力の空間的一致性を活用することで、明示的な教師信号なしに意味的対応関係を発見する。

実験結果

リサーチクエスチョン

  • RQ12次元の教師信号のみで真値のカメラポーズを必要とせず、1枚の画像から正確に3D形状とカメラポーズを回復できるか?
  • RQ2微分可能なポイントクラウドは、教師なし学習下でボクセルベースの手法よりも優れた高精度な3D再構築を可能にするか?
  • RQ3複数のポーズ予測器を訓練し、それらを知識蒸留することで、単一モデルの学習に比べてポーズの曖昧さに対するロバストネスが向上するか?
  • RQ4明示的な教師信号なしに、ポイントクラウド表現から3Dオブジェクトインスタンス間の意味的対応関係が自動的に発生するか?
  • RQ5本手法は、既存の教師なし3D再構築手法と定量的・定性的に比較してどのように評価されるか?

主な発見

  • アンサンブル蒸留を含む完全な手法は平均ポーズ誤差7.1°を達成し、ナイーブモデル(9.0°)を著しく上回り、真値ポーズで学習したモデル(6.7°)の性能に近づいた。
  • ポイントクラウド表現により、細部の形状モデリングが可能で、薄い椅子の脚のような細かく精巧な構造が可視化され、MVCのようなボクセルベース手法に比べて視覚的忠実度が優れている。
  • 意味的対応関係が自動で発見される:図6の同じ色で示されるポイントは、異なる椅子インスタンス間で同じオブジェクト部品(例:脚の先端、座席の角)を表しており、明示的な教師信号なしに達成された。
  • 本手法は実世界のデータに対しても良好に一般化できる。真値のカメラポーズが正確に必要とされないため、非構造的な画像コレクションからの学習に適している。
  • アブレーションスタディにより、アンサンブルベースのアプローチが正確なポーズ推定に不可欠であることが確認された。ナイーブモデルは曖昧なポーズに一般化に失敗した。
  • 微分可能な投影演算子により、2次元の教師信号を用いたエンドツーエンドの学習が可能となり、2次元ディープラーニング技術(例:パーセプチュアル損失、GAN)を3D生成に直接応用できるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。