Skip to main content
QUICK REVIEW

[論文レビュー] Few-View Object Reconstruction with Unknown Categories and Camera Poses

Hanwen Jiang, Zhenyu Jiang|arXiv (Cornell University)|Dec 8, 2022
Advanced Vision and Imaging被引用数 5
ひとこと要約

FORGE は、物体のカテゴリーやカメラの姿勢に関する事前知識がなくても、形状再構築と相対カメラ姿勢推定を同時に最適化することで、未校正の画像から少数のビューでの3Dオブジェクト再構築を可能にする。3D特徴学習、視点間一貫性、明示的な3D相関を活用し、再構築と姿勢推定の両面で最先端の性能を達成し、最小限の監督のもとで未知のオブジェクトカテゴリに効果的に一般化する。

ABSTRACT

While object reconstruction has made great strides in recent years, current methods typically require densely captured images and/or known camera poses, and generalize poorly to novel object categories. To step toward object reconstruction in the wild, this work explores reconstructing general real-world objects from a few images without known camera poses or object categories. The crux of our work is solving two fundamental 3D vision problems -- shape reconstruction and pose estimation -- in a unified approach. Our approach captures the synergies of these two problems: reliable camera pose estimation gives rise to accurate shape reconstruction, and the accurate reconstruction, in turn, induces robust correspondence between different views and facilitates pose estimation. Our method FORGE predicts 3D features from each view and leverages them in conjunction with the input images to establish cross-view correspondence for estimating relative camera poses. The 3D features are then transformed by the estimated poses into a shared space and are fused into a neural radiance field. The reconstruction results are rendered by volume rendering techniques, enabling us to train the model without 3D shape ground-truth. Our experiments show that FORGE reliably reconstructs objects from five views. Our pose estimation method outperforms existing ones by a large margin. The reconstruction results under predicted poses are comparable to the ones using ground-truth poses. The performance on novel testing categories matches the results on categories seen during training. Project page: https://ut-austin-rpl.github.io/FORGE/

研究の動機と目的

  • オブジェクトのカテゴリーやカメラの姿勢が未知である実世界の設定において、少数のビューからの3Dオブジェクト再構築を可能にすること。
  • 従来の手法が必要とする高密度な画像、既知の姿勢、またはカテゴリ固有の監督を必要としない限界を克服すること。
  • 3D再構築と相対カメラ姿勢推定の両方を統合的に向上させるフレームワークを構築すること。
  • トレーニング時に見られなかった新しいオブジェクトカテゴリに対しても、効果的に一般化できること。
  • 3D形状の真値が不要な状態で、微分可能なボリュームレンダリングを用いた画像再構築損失のみで学習すること。

提案手法

  • FORGE は、視点間一貫性損失を用いて訓練されたボクセルエンコーダーを用いて、各入力画像を3Dボクセル特徴に変換する。
  • 2D画像特徴と3Dボクセル特徴を統合したグローバルなポーズ特徴抽出器を用いて、すべての入力ビュー間の相対カメラポーズを推定し、明示的な3D視点間相関を確立する。
  • 相対ポーズ推定器は、すべてのビューにわたる共同推論を可能にする自己注意ブロックを用い、2点間推定による誤差蓄積を低減する。
  • 3D特徴は予測された相対ポーズを用いて共有再構築空間に変換され、特徴集約によりニューラルレイトランスフィールドに統合される。
  • モデルは、レンダリングされた新規ビューと入力画像間の再構築損失を用いてエンドツーエンドで訓練され、3D形状の監督が不要になる。
  • 段階的トレーニング戦略として、まず真値ポーズを用いて堅牢な3D特徴事前知識を学習し、その後、視点一貫性のある3D特徴空間でポーズ推定器を訓練する。

実験結果

リサーチクエスチョン

  • RQ1カテゴリ固有の監督や標準空間の監督がなくても、少数のビューでの3D再構築モデルは未知のオブジェクトカテゴリに一般化可能か?
  • RQ2大きなポーズ変動を伴う少数の未校正ビューから、相対カメラポーズを正確に推定するにはどうすればよいか?
  • RQ33D再構築とポーズ推定の共同最適化が、両タスクのパフォーマンス向上にどの程度寄与するか?
  • RQ43D特徴空間における視点間一貫性を強制することで、大きな視点変動下でもポーズ推定のロバスト性が向上するか?
  • RQ5少数のビュー設定において、明示的な3D相関学習は、暗黙的または2Dベースの相関を上回る性能を発揮するか?

主な発見

  • FORGE はテスト時最適化後にポーズ推定で30%の性能向上を達成し、以前の最高手法である8-Point Transformer を大きく上回った。
  • FORGE の回転誤差と並進誤差は、以前の最先端手法の半分であり、既知のカテゴリと未知のカテゴリの間で一般化ギャップがたった5度にとどまった。
  • 予測されたポーズを用いた再構築品質は、真値ポーズを用いた場合と同等であり、ポーズ推定誤差に対してロバストであることを示した。
  • モデルは未知のオブジェクトカテゴリに対しても効果的に一般化し、見ていたカテゴリとほぼ同等の性能を達成し、PSNR と SSIM の低下が最小限に抑えられた。
  • アブレーションスタディにより、視点間一貫性損失と明示的な3D相関が、信頼性の高いポーズ推定に不可欠であることが確認され、欠落した場合の性能低下が60%減少した。
  • 平均プーリングと逐次的特徴統合の融合により再構築品質が向上し、エンコーダーに3D U-Net を使用しないことで、カテゴリ間での一般化能力が維持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。