Skip to main content
QUICK REVIEW

[论文解读] Colonoscopy 3D Video Dataset with Paired Depth from 2D-3D Registration

Taylor L. Bobrow, Mayank Golhar|arXiv (Cornell University)|Jun 17, 2022
Advanced Vision and Imaging被引用 4
一句话总结

本论文提出了结肠镜3D视频数据集(C3VD),这是一个用于结肠镜3D视觉计算的高保真基准数据集,通过一种新颖的2D-3D配准流程,将真实高清结肠镜视频与合成3D模型进行配准而构建。该方法利用生成对抗网络(GAN)从2D图像帧预测深度,并采用进化优化器对齐边缘特征,实现了0.321 mm的平移误差和0.159°的旋转误差,从而在10,015帧中实现了深度、法向量、光流和位姿的像素级真实值标注。

ABSTRACT

Screening colonoscopy is an important clinical application for several 3D computer vision techniques, including depth estimation, surface reconstruction, and missing region detection. However, the development, evaluation, and comparison of these techniques in real colonoscopy videos remain largely qualitative due to the difficulty of acquiring ground truth data. In this work, we present a Colonoscopy 3D Video Dataset (C3VD) acquired with a high definition clinical colonoscope and high-fidelity colon models for benchmarking computer vision methods in colonoscopy. We introduce a novel multimodal 2D-3D registration technique to register optical video sequences with ground truth rendered views of a known 3D model. The different modalities are registered by transforming optical images to depth maps with a Generative Adversarial Network and aligning edge features with an evolutionary optimizer. This registration method achieves an average translation error of 0.321 millimeters and an average rotation error of 0.159 degrees in simulation experiments where error-free ground truth is available. The method also leverages video information, improving registration accuracy by 55.6% for translation and 60.4% for rotation compared to single frame registration. 22 short video sequences were registered to generate 10,015 total frames with paired ground truth depth, surface normals, optical flow, occlusion, six degree-of-freedom pose, coverage maps, and 3D models. The dataset also includes screening videos acquired by a gastroenterologist with paired ground truth pose and 3D surface models. The dataset and registration source code are available at durr.jhu.edu/C3VD.

研究动机与目标

  • 为评估结肠镜中3D视觉计算技术(如深度估计与表面重建)提供真实值数据,以解决当前缺乏真实值数据的问题。
  • 开发一种稳健的2D-3D配准方法,实现真实结肠镜视频与结肠合成3D模型之间的精确对齐。
  • 创建一个包含像素级真实值的基准数据集,涵盖深度、表面法向量、光流、遮挡与6自由度位姿,以支持SLAM、覆盖度映射与病灶检测研究。
  • 通过使用真实的临床结肠内镜影像,克服传统合成渲染的局限性,保留真实的光学效果、光照条件与运动特性。
  • 公开3D模型、制造工艺与配准代码,以支持研究社区的可复现性与进一步拓展。

提出的方法

  • 提出一种新颖的多模态2D-3D配准技术,结合生成对抗网络(GAN)将光学图像帧转换为深度图。
  • 利用进化优化器对齐来自光学图像与渲染深度图的边缘特征,以估计6自由度相机位姿。
  • 通过引入视频序列提升时间一致性,相较于单帧配准,平移误差降低55.6%,旋转误差降低60.4%。
  • 采用硅胶模具构建高保真3D结肠模型,其管状几何结构可模拟真实结肠解剖结构。
  • 通过已知3D模型的渲染生成真实值数据,包括深度、表面法向量、光流、遮挡与覆盖度图。
  • 使用安装在机械臂上的临床高清结肠镜采集数据,以确保精确的轨迹追踪与位姿测量。

实验结果

研究问题

  • RQ12D-3D配准流程能否在将真实结肠镜视频与合成3D模型对齐时,实现亚毫米级与亚度级的精度?
  • RQ2与单帧方法相比,视频时序信息在多大程度上提升了2D-3D配准的准确性?
  • RQ3基于GAN的深度预测模型能否有效弥合真实光学图像与合成深度图之间的域差距,适用于结肠镜场景?
  • RQ4所生成的数据集在多大程度上能够支持结肠镜中3D重建、视觉里程计与覆盖度估计的评估?
  • RQ5与合成渲染相比,使用真实临床内镜影像对3D视觉计算算法基准测试的有效性有何影响?

主要发现

  • 所提出的2D-3D配准方法在模拟环境中实现了平均0.321 mm的平移误差与平均0.159°的旋转误差。
  • 引入视频信息后,与单帧配准相比,平移误差降低55.6%,旋转误差降低60.4%。
  • C3VD数据集包含22段短视频序列,共10,015帧,每帧均标注有真实深度、表面法向量、光流、遮挡、6自由度位姿、覆盖度图与3D模型。
  • 数据集使用真实高清临床结肠镜采集,保留了非全局光照、传感器噪声等真实光学效应。
  • 3D模型资源、模具文件与制造工艺已开源,使研究人员能够复现并扩展该类体模模型。
  • 该数据集支持在临床相关场景下对SLAM、覆盖度估计、息肉检测与深度估计算法进行基准测试。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。