[论文解读] EndoGS: Deformable Endoscopic Tissues Reconstruction with Gaussian Splatting
EndoGS 提出了一种基于高斯溅射的首个方法,用于从单视角视频中实现高保真、实时重建可变形内镜组织。通过整合形变场、基于深度的监督与时空掩码,以及表面对齐正则化,该方法在渲染质量上达到最先进水平,且达到约70 FPS,显著优于以往基于NeRF的方法在质量和速度方面的表现。
Surgical 3D reconstruction is a critical area of research in robotic surgery, with recent works adopting variants of dynamic radiance fields to achieve success in 3D reconstruction of deformable tissues from single-viewpoint videos. However, these methods often suffer from time-consuming optimization or inferior quality, limiting their adoption in downstream tasks. Inspired by 3D Gaussian Splatting, a recent trending 3D representation, we present EndoGS, applying Gaussian Splatting for deformable endoscopic tissue reconstruction. Specifically, our approach incorporates deformation fields to handle dynamic scenes, depth-guided supervision with spatial-temporal weight masks to optimize 3D targets with tool occlusion from a single viewpoint, and surface-aligned regularization terms to capture the much better geometry. As a result, EndoGS reconstructs and renders high-quality deformable endoscopic tissues from a single-viewpoint video, estimated depth maps, and labeled tool masks. Experiments on DaVinci robotic surgery videos demonstrate that EndoGS achieves superior rendering quality. Code is available at https://github.com/HKU-MedAI/EndoGS.
研究动机与目标
- 为解决从单视角视频重建高质量、动态内镜组织的挑战,该问题因遮挡和大形变而具有病态性。
- 克服现有基于NeRF方法的局限性,例如优化速度慢以及在器械遮挡下泛化能力差。
- 利用三维高斯溅射的速度与保真度优势,实现外科手术三维重建的实时应用。
- 通过表面对齐正则化提升重建场景的几何精度,特别是在器械遮挡区域。
提出的方法
- 通过静态三维高斯与基于轻量级MLP建模的时间相关形变场的组合,表示动态外科场景。
- 在单目优化过程中,应用基于深度的监督与时空权重掩码,以处理器械遮挡问题。
- 引入表面对齐正则化,通过将高斯与潜在组织表面对齐,提升几何保真度。
- 使用可微分光栅化技术渲染新视角,并基于真实图像、深度图和器械掩码进行优化。
- 采用两阶段训练策略:首先优化静态高斯,然后通过额外迭代优化形变场。
- 利用多分辨率体素平面从高斯的均值和时间中提取特征,用于形变预测。
实验结果
研究问题
- RQ1高斯溅射能否被有效适配于从单视角视频中高保真、实时重建可变形内镜组织?
- RQ2在使用隐式或显式监督进行三维重建时,如何缓解单目内镜视频中的器械遮挡问题?
- RQ3表面对齐正则化在提升几何精度并减少遮挡区域伪影方面发挥何种作用?
- RQ4基于时空掩码的深度引导监督如何在部分可见条件下提升重建质量?
- RQ5结合形变建模与三维高斯溅射是否能在渲染质量与推理速度两方面均优于现有基于NeRF的方法?
主要发现
- EndoGS 在所有指标上显著优于EndoNeRF与ForPlane,取得PSNR 37.935(±0.088)、SSIM 0.966(±0.003)与LPIPS 0.034(±0.001)。
- 该方法实现约70 FPS,显著优于EndoNeRF(<0.2 FPS)与ForPlane(~1.7 FPS),证明其具备实时能力。
- 消融研究证实,空间总变差损失可减少遮挡区域的颜色漂移,提升视觉一致性。
- 表面对齐正则化有效减少模糊并保留器械遮挡区域附近的精细细节,定性对比结果清晰显示。
- 在训练与推理中使用一致的器械掩码,确保了公平比较,并增强了对遮挡的鲁棒性。
- EndoGS 在具有大非刚性形变的挑战性场景(如“牵引”与“牵拉软组织”)中展现出更优的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。