[論文レビュー] Gaussian Grouping: Segment and Edit Anything in 3D Scenes
Gaussian Grouping は、3Dガウススプラッタリングを拡張し、学習可能なアイデンティティ符号化を導入してガウス分布をオブジェクトインスタンスおよびストัฟ(物質)セグメンテーションにグループ化することで、SAMの2Dマスクと3D空間的一致性正則化のみを用いて、高精度な3D再構築と細粒度セグメンテーションを実現します。本手法は最小限の監視のもとで高精細で編集可能な3Dシーンを生成でき、再トレーニングなしに効率的な局所的編集を可能にします。
The recent Gaussian Splatting achieves high-quality and real-time novel-view synthesis of the 3D scenes. However, it is solely concentrated on the appearance and geometry modeling, while lacking in fine-grained object-level scene understanding. To address this issue, we propose Gaussian Grouping, which extends Gaussian Splatting to jointly reconstruct and segment anything in open-world 3D scenes. We augment each Gaussian with a compact Identity Encoding, allowing the Gaussians to be grouped according to their object instance or stuff membership in the 3D scene. Instead of resorting to expensive 3D labels, we supervise the Identity Encodings during the differentiable rendering by leveraging the 2D mask predictions by Segment Anything Model (SAM), along with introduced 3D spatial consistency regularization. Compared to the implicit NeRF representation, we show that the discrete and grouped 3D Gaussians can reconstruct, segment and edit anything in 3D with high visual quality, fine granularity and efficiency. Based on Gaussian Grouping, we further propose a local Gaussian Editing scheme, which shows efficacy in versatile scene editing applications, including 3D object removal, inpainting, colorization, style transfer and scene recomposition. Our code and models are at https://github.com/lkeab/gaussian-grouping.
研究の動機と目的
- 高価な3Dアノテーションを必要とせず、オープンワールド環境において細粒度のインスタンスレベルの3Dシーン理解を可能にすること。
- 再構築とセグメンテーションの両方をサポートするアイデンティティに注意を向ける表現を3Dガウススプラッタリングに拡張すること。
- オブジェクトの削除、インpainting、再構成などの多様な3Dシーン編集を、グループ化された3Dガウス分布から直接可能にすること。
- ゼロショット2Dセグメンテーション(SAM)と3D空間的一致性を活用し、手動での3Dラベル付けなしに3Dグループ化を監視すること。
- 高精細な3D再構築とセグメンテーションを、効率的な学習とレンダリングで達成し、implicit NeRFベースの手法よりも編集性と速度で優れること。
提案手法
- 各3Dガウス分布に16次元の学習可能なアイデンティティ符号化を追加し、オブジェクトインスタンスまたはストัフ(物質)の所属を表現する。
- 3Dガウス分布を2Dビューに投影し、共有の線形層を用いてスプラットされた埋め込みを分類することで、微分可能なレンダリングによりアイデンティティ符号化を学習する。
- SAMが生成するマスクに基づく2Dクロスエントロピー損失と、特徴空間における最も近いK個のガウス分布を一致させる3D空間的一致性正則化損失を用いて、アイデンティティグループ化を監視する。
- 球面調和関数に類似したCUDA最適化された前向き・逆向きパスを備えた微分可能なラスタライゼーションパイプラインを用い、効率的なエンドツーエンド学習を実現する。
- 通常のガウススプラッタリング最適化に加え、プルーニングとデンシフィケーションを統合し、精錬過程でもアイデンティティ符号化を保持する。
- グループ化されたガウス分布の直接操作により、局所的編集(削除、色指定、再配置など)を可能にし、インパティングには最小限のファインチューニングで対応する。

実験結果
リサーチクエスチョン
- RQ1学習可能なアイデンティティ符号化を3Dガウス分布に追加することで、3D監視なしに3D再構築と細粒度セグメンテーションを同時に実現できるか?
- RQ2SAMの2Dマスクと3D空間的一致性正則化を組み合わせた監視は、正確な3Dグループ化を達成するのにどの程度有効か?
- RQ3離散的かつグループ化された3Dガウス分布は、オブジェクトの削除、インパティング、再構成を含む、効率的で高品質な3Dシーン編集を可能にするか?
- RQ4Gaussian Grouping は、再構築品質、セグメンテーション精度、編集性の観点から、implicit NeRFベースの手法と比較してどの程度優れているか?
- RQ5本手法は、多様なオブジェクトタイプと複雑な構成を含むオープンワールド3Dシーンにどの程度一般化可能か?
主な発見
- Gaussian Grouping は、SAMの2Dマスクと3D空間的一致性正則化のみを用いても、高視覚的品質の3D新規ビュー合成と高密度3Dセグメンテーションを達成する。
- 本手法は、グループ化されたガウス分布の構成的構造を活用し、トレーニングなしに直接3D編集(オブジェクトの削除、色指定、位置交換など)を可能にする。
- 3Dオブジェクトのインパティングには数分間のファインチューニングで十分であり、編集タスクへの効率的適応を示している。
- 3D空間的一致性正則化損失は、特に隠蔽されたり可視性が低いガウス分布において、周囲の点同士の特徴の一貫性を強制することでグループ化の正確性を向上させる。
- 1台のA100 GPUで30Kイテレーション学習することで、再構築とセグメンテーションにおいて最先端の性能を達成し、高速な推論とレンダリングを実現する。
- グループ化された3Dガウス分布の明示的・離散的・分解可能な性質のおかげで、implicit NeRFベースの手法よりも編集性と効率性で優れている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。