[论文解读] Gaussian Grouping: Segment and Edit Anything in 3D Scenes
Gaussian Grouping 通过引入可学习的标识编码,将 3D 高斯分布扩展为对象实例和物质区域的分组,实现了仅使用 SAM 生成的 2D 掩码和 3D 空间一致性正则化,即可联合完成 3D 重建与细粒度分割。该方法在极少监督下实现了高保真、可编辑的 3D 场景,并支持无需微调的高效局部编辑。
The recent Gaussian Splatting achieves high-quality and real-time novel-view synthesis of the 3D scenes. However, it is solely concentrated on the appearance and geometry modeling, while lacking in fine-grained object-level scene understanding. To address this issue, we propose Gaussian Grouping, which extends Gaussian Splatting to jointly reconstruct and segment anything in open-world 3D scenes. We augment each Gaussian with a compact Identity Encoding, allowing the Gaussians to be grouped according to their object instance or stuff membership in the 3D scene. Instead of resorting to expensive 3D labels, we supervise the Identity Encodings during the differentiable rendering by leveraging the 2D mask predictions by Segment Anything Model (SAM), along with introduced 3D spatial consistency regularization. Compared to the implicit NeRF representation, we show that the discrete and grouped 3D Gaussians can reconstruct, segment and edit anything in 3D with high visual quality, fine granularity and efficiency. Based on Gaussian Grouping, we further propose a local Gaussian Editing scheme, which shows efficacy in versatile scene editing applications, including 3D object removal, inpainting, colorization, style transfer and scene recomposition. Our code and models are at https://github.com/lkeab/gaussian-grouping.
研究动机与目标
- 在无需昂贵 3D 标注的情况下,实现在开放世界环境中对 3D 场景进行细粒度、实例级理解。
- 通过引入具备身份感知能力的表示,扩展 3D 高斯分布,使其同时支持重建与分割。
- 实现多样化 3D 场景编辑(如对象移除、图像修复与重新构图),直接基于分组后的 3D 高斯分布完成。
- 利用零样本 2D 分割(SAM)与 3D 空间一致性监督 3D 分组过程,无需人工 3D 标注。
- 在训练与渲染效率方面实现高保真 3D 重建与分割,其可编辑性与速度优于基于隐式 NeRF 的方法。
提出的方法
- 为每个 3D 高斯分布增加一个 16 维可学习的标识编码,以表示对象实例或物质区域的归属。
- 通过可微分渲染训练标识编码:将 3D 高斯分布投影到 2D 视图,并使用共享的线性层对点阵嵌入进行分类。
- 使用基于 SAM 生成掩码的 2D 交叉熵损失,以及对 3D 特征空间中最近邻 K 个高斯分布进行对齐的 3D 空间一致性正则化损失,监督标识分组。
- 采用类似球谐函数的 CUDA 优化的前向与反向传播可微分光栅化流水线,实现高效端到端训练。
- 将标准的高斯点阵优化与剪枝、密集化策略结合,同时在优化过程中保留标识编码。
- 通过直接操作分组后的高斯分布实现局部编辑,包括移除、着色与重定位,图像修复任务仅需极少微调。

实验结果
研究问题
- RQ1能否通过可学习的标识编码扩展 3D 高斯分布,实现在无 3D 监督下联合完成 3D 重建与细粒度分割?
- RQ2结合 SAM 生成的 2D 掩码与 3D 空间一致性正则化,在实现准确 3D 分组方面效果如何?
- RQ3离散的、分组后的 3D 高斯分布能否支持高效且高质量的 3D 场景编辑,包括对象移除、图像修复与重新构图?
- RQ4与基于隐式 NeRF 的方法相比,Gaussian Grouping 在重建质量、分割准确率与可编辑性方面的表现如何?
- RQ5该方法在包含多样化对象类型与复杂构型的开放世界 3D 场景中,泛化能力如何?
主要发现
- Gaussian Grouping 仅使用 SAM 生成的 2D 掩码与 3D 空间一致性正则化,即可在 3D 新视角合成与密集 3D 分割方面实现高视觉质量。
- 该方法可直接进行 3D 编辑(如对象移除、着色与位置互换),无需任何训练,充分利用了分组高斯分布的组合结构。
- 3D 对象图像修复仅需数分钟微调,展现出对编辑任务的高效适应能力。
- 3D 空间一致性正则化损失通过强制邻近点间特征一致性,显著提升了遮挡或低可见度高斯分布的分组准确性。
- 在单张 A100 GPU 上训练 30K 次迭代,即可实现重建与分割的最先进性能,且推理与渲染速度极快。
- 由于分组后 3D 高斯分布具有显式、离散且可分解的特性,该方法在可编辑性与效率方面优于基于隐式 NeRF 的方法。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。