Skip to main content
QUICK REVIEW

[論文レビュー] GS2Mesh: Surface Reconstruction from Gaussian Splatting via Novel Stereo Views

Yaniv Wolf, Amit Bracha|arXiv (Cornell University)|Apr 2, 2024
3D Surveying and Cultural HeritageEarth and Planetary Sciences被引用数 3
ひとこと要約

本稿では、3Dガウススプラッタリング(3DGS)モデルから表面再構築を行う新規手法GS2Meshを提案する。本手法はステレオキャリブレートされた新規視点再構築を活用して正確なRGB-Dデータを生成し、その後TSDFを用いて統合することで幾何学的に一貫性のあるメッシュを生成する。スマートフォンで撮影されたシーンにおいても、追加で5分未塔の計算時間で最先端の再構築品質を達成し、精度と効率の両面で先行手法を上回る。

ABSTRACT

Recently, 3D Gaussian Splatting (3DGS) has emerged as an efficient approach for accurately representing scenes. However, despite its superior novel view synthesis capabilities, extracting the geometry of the scene directly from the Gaussian properties remains a challenge, as those are optimized based on a photometric loss. While some concurrent models have tried adding geometric constraints during the Gaussian optimization process, they still produce noisy, unrealistic surfaces. We propose a novel approach for bridging the gap between the noisy 3DGS representation and the smooth 3D mesh representation, by injecting real-world knowledge into the depth extraction process. Instead of extracting the geometry of the scene directly from the Gaussian properties, we instead extract the geometry through a pre-trained stereo-matching model. We render stereo-aligned pairs of images corresponding to the original training poses, feed the pairs into a stereo model to get a depth profile, and finally fuse all of the profiles together to get a single mesh. The resulting reconstruction is smoother, more accurate and shows more intricate details compared to other methods for surface reconstruction from Gaussian Splatting, while only requiring a small overhead on top of the fairly short 3DGS optimization process. We performed extensive testing of the proposed method on in-the-wild scenes, obtained using a smartphone, showcasing its superior reconstruction abilities. Additionally, we tested the method on the Tanks and Temples and DTU benchmarks, achieving state-of-the-art results.

研究の動機と目的

  • 3Dガウススプラッタリング(3DGS)モデルから生じる幾何学的に一貫性のない、ノイズの多い表面再構築の課題に取り組むこと。これは、ガウス要素の位置が表面と整合しないことが原因である。
  • 3DGSの優れた新規視点再構築能力を活用することで、ガウス中心に依存するのではなく、再構築の精度と詳細の忠実度を向上させること。
  • 特に一般のユーザーが撮影したコンsumerデバイスを用いたシーンにおいて、既存手法と比較して表面再構築の計算時間を短縮すること。
  • 深度マップとSAMベースのセグメンテーションを組み合わせることで、正確で準自動的なオブジェクト固有のメッシュ再構築を可能にすること。
  • Tanks and Temples や Mip-NeRF360 といったベンチマークデータセットで、現在の最先端手法であるSuGaRを上回ること。

提案手法

  • 本手法はまず、写真的にリアルな新規視点レンダリングを最適化するガウス要素を用いて3DGSでシーンをキャプチャする。
  • 次に、慎重に選択された仮想カメラポーズを用いて、3DGSモデルからステレオキャリブレートされた新規視点を生成する。
  • 各ステレオペアに対してディープステレオマッチングモデルを適用し、高品質な深度マップを抽出し、RGB-Dデータを構築する。
  • 複数の視点からのRGB-Dデータを、切り捨て signed distance function(TSDF)アルゴリズムを用いて統合し、幾何学的に一貫性のある表面を生成する。
  • オブジェクト固有の再構築のため、本手法は深度マップとSegment-Anything(SAM)からのセグメンテーションマスクを統合して個々のオブジェクトを分離・再構築する。
  • このパイプラインは、初期の3DGSキャプチャの上に追加で約5分の計算時間しか追加せず、スマートフォンで撮影されたシーンに対しても同様に適用可能である。

実験結果

リサーチクエスチョン

  • RQ13DGSモデルからのステレオキャリブレートされた新規視点再構築は、ガウス中心からの直接再構築と比較して、より正確な深度マップを生成できるか?
  • RQ23DGSが内蔵する視点再構築の質を活用することで、ガウス幾何学を正則化する手法と比較して、優れた表面再構築が達成できるか?
  • RQ3本手法は、Tanks and Temples などのベンチマークデータセットで最先端の精度を達成しつつ、計算オーバーヘッドを低く抑えられるか?
  • RQ4一般のシーン(in-the-wild)でスマートフォンで撮影されたシーンにおいて、3DGSベースの新規視点とステレオマッチング、TSDF統合の統合はどの程度効果的か?
  • RQ5セグメンテーションと深度統合を用いて、正確で準自動的なオブジェクト固有のメッシュ再構築が可能か?

主な発見

  • Tanks and Temples ベンチマークにおいて、GS2Meshは、3DGSからの表面再構築における以前の最先端手法であるSuGaRを、精度と効率の両面で上回った。
  • スマートフォンで撮影された一般のシーンでは、本手法は細部まで高精細な再構築を達成し、小さなテーブルのすきまなども正確に再現し、BakedSDFと同等またはそれを上回る品質を示したが、はるかに少ない時間で実現した。
  • MobileBrick データセットにおけるアブレーションスタディでは、3DGSからレンダリングされた画像を用いることで、元の画像と比較してリCALL(88.45%)とF1スコア(85.50%)が向上し、Chamfer距離も低くなった(5.76 mm)。
  • スマートフォンで撮影されたシーンにおいて、初期の3DGSキャプチャ後、表面再構築時間を5分未塔にまで短縮した。これは、極めて高い効率性を示している。
  • MVSを元の画像に適用した場合と比較して、本手法はクリアで穴の少ない再構築を実現しており、3DGSのレンダリングが視点の一貫性を向上させ、ノイズを低減していることを示している。
  • 主な制限として、撮影が不十分な領域における「フラーター」ガウスのアーチファクトや、ステレオマッチングの失敗による透明な表面の誤りが見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。