[论文解读] Dense Depth Estimation in Monocular Endoscopy with Self-supervised Learning Methods
本文提出了一种用于单目内窥镜的自监督深度学习方法,仅需未标注的内窥镜视频和由运动结构法(SfM)生成的稀疏三维重建,无需任何人工标注、CT扫描或光度一致性假设。该方法在跨患者评估中实现了亚毫米级的平均残差误差,并在活体鼻窦内窥镜数据上优于现有自监督方法。
We present a self-supervised approach to training convolutional neural networks for dense depth estimation from monocular endoscopy data without a priori modeling of anatomy or shading. Our method only requires monocular endoscopic videos and a multi-view stereo method, e.g., structure from motion, to supervise learning in a sparse manner. Consequently, our method requires neither manual labeling nor patient computed tomography (CT) scan in the training and application phases. In a cross-patient experiment using CT scans as groundtruth, the proposed method achieved submillimeter mean residual error. In a comparison study to recent self-supervised depth estimation methods designed for natural video on in vivo sinus endoscopy data, we demonstrate that the proposed approach outperforms the previous methods by a large margin. The source code for this work is publicly available online at https://github.com/lppllppl920/EndoscopyDepthEstimation-Pytorch.
研究动机与目标
- 开发一种自监督方法,用于单目内窥镜中的密集深度估计,避免依赖人工标注或术前CT扫描。
- 解决由于低纹理、高光反射和组织形变导致的内窥镜视频中稀疏且不一致的深度重建问题。
- 在不依赖光度一致性或解剖先验的前提下,实现用于手术导航的精确三维重建。
- 仅使用未标注的视频数据,实现在不同患者和内窥镜相机之间的泛化。
- 通过引入不依赖光度相似性的几何一致性损失,提高对SfM误差的鲁棒性。
提出的方法
- 该方法利用由运动结构法(SfM)生成的稀疏三维重建,结合监督与自监督损失,训练卷积神经网络。
- 提出一种新型可微分几何一致性损失(DCL),强制连续帧预测深度图之间的刚性变换,从而在低纹理或高光区域提升泛化能力。
- 第二种损失为稀疏特征损失(SFL),利用SfM生成的稀疏深度点对网络进行监督,无需密集真实值。
- 网络架构通过结合SFL与DCL的多任务损失端到端训练,实现从单张单目图像预测密集深度图。
- 该方法不假设帧间光度一致性,因此对内窥镜中常见的光照变化和高光反射具有鲁棒性。
- 训练过程完全自监督,仅依赖单目视频和SfM输出,无需人工标注或CT扫描。
实验结果
研究问题
- RQ1是否可以在无需任何人工标注或术前CT扫描的情况下实现单目内窥镜中的密集深度估计?
- RQ2在缺乏光度一致性的前提下,如何在连续帧之间强制实现几何一致性?
- RQ3自监督深度学习模型是否能仅使用未标注视频数据,在不同患者和内窥镜相机之间实现泛化?
- RQ4在真实活体内窥镜数据上,该方法与现有自监督深度估计技术相比表现如何?
- RQ5像DCL这样的几何一致性损失在具有高光反射和低纹理的挑战性内窥镜环境中,能在多大程度上提升深度估计性能?
主要发现
- 在使用CT扫描作为真实值的跨患者评估中,所提方法实现了小于1 mm的平均残差误差,表明其在不同患者间具有强大的泛化能力。
- 在活体鼻窦内窥镜数据上,该方法显著优于两种近期的自监督深度估计方法,表明其具备更高的鲁棒性和准确性。
- 引入可微分几何一致性损失(DCL)显著提升了在SfM点缺失或不准确区域(如边界附近或高光区域)的性能。
- 该方法在不同内窥镜相机和患者之间具有良好的泛化能力,跨患者实验表明仅需极少微调。
- 模型可生成至全局尺度的密集深度图,作者指出可通过外部标定或应用中已知尺寸的物体实现全局尺度恢复。
- 基于CT的残差误差评估可能因最近点配对的性质而低估真实误差,提示基于SfM的评估更能反映在具有有效稀疏对应关系区域的真实精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。