Skip to main content
QUICK REVIEW

[论文解读] A Robotic 3D Perception System for Operating Room Environment Awareness

Zhaoshuo Li, Amirreza Shaban|arXiv (Cornell University)|Mar 20, 2020
Surgical Simulation and Training参考文献 17被引用 8
一句话总结

本论文提出了一种基于四台安装在达芬奇Xi手术机器人患者侧器械臂上的飞行时间(ToF)相机的动态多视角三维感知系统,用于实现实时手术室(OR)场景理解。通过一种新型基于学习的多视角投影与融合(MVPM)算法,融合2D强度图像与3D点云数据,该系统在单视角方法的基础上显著提升了语义分割性能,特别是对低频类别。对于麻醉车的平均交并比(mIOU)达到0.711±0.031,对于Mayo托盘的mIOU为0.687±0.060。

ABSTRACT

Purpose: We describe a 3D multi-view perception system for the da Vinci surgical system to enable Operating room (OR) scene understanding and context awareness. Methods: Our proposed system is comprised of four Time-of-Flight (ToF) cameras rigidly attached to strategic locations on the daVinci Xi patient side cart (PSC). The cameras are registered to the robot's kinematic chain by performing a one-time calibration routine and therefore, information from all cameras can be fused and represented in one common coordinate frame. Based on this architecture, a multi-view 3D scene semantic segmentation algorithm is created to enable recognition of common and salient objects/equipment and surgical activities in a da Vinci OR. Our proposed 3D semantic segmentation method has been trained and validated on a novel densely annotated dataset that has been captured from clinical scenarios. Results: The results show that our proposed architecture has acceptable registration error ($3.3\%\pm1.4\%$ of object-camera distance) and can robustly improve scene segmentation performance (mean Intersection Over Union - mIOU) for less frequently appearing classes ($\ge 0.013$) compared to a single-view method. Conclusion: We present the first dynamic multi-view perception system with a novel segmentation architecture, which can be used as a building block technology for applications such as surgical workflow analysis, automation of surgical sub-tasks and advanced guidance systems.

研究动机与目标

  • 开发一种用于达芬奇手术机器人上实时手术室(OR)场景理解的动态多视角3D感知系统。
  • 解决在复杂、遮挡严重的OR环境中,因单视角视野受限而导致的鲁棒语义分割挑战。
  • 通过引入一种一次性校准方法,实现在达芬奇Xi平台上的多相机系统可扩展、可嵌入的机器人感知。
  • 创建一种新型、密集标注的数据集,用于在临床OR环境中训练和验证多视角3D语义分割。
  • 通过多视角融合提升对低频物体(如Mayo托盘、麻醉车)的分割精度,克服单视角方法的局限性。

提出的方法

  • 四台飞行时间(ToF)相机被刚性安装在达芬奇Xi患者侧器械臂(PSC)的特定位置,以最大化场景覆盖范围。
  • 通过专用夹具和刚性安装结构,执行一次性的校准流程,将所有相机与机器人的运动学链路对齐,实现统一的坐标变换。
  • 系统使用一种新型基于学习的多视角投影与融合(MVPM)技术,将所有相机的2D强度图像与3D点云数据融合至统一的机器人基坐标系中。
  • MVPM算法学习在不同视角之间融合像素级分割标签与置信度分数,提升预测的一致性与区域平滑性。
  • 从临床达芬奇OR场景中采集了一套全新的、密集标注的多视角数据集,用于训练和验证语义分割模型。
  • 框架采用DeepLab V3+作为单视角分割的主干网络,MVPM在预测后应用,利用多视角一致性优化输出结果。

实验结果

研究问题

  • RQ1与单视角方法相比,安装在达芬奇手术机器人上的多视角3D感知系统是否能在真实OR环境中提升语义分割精度?
  • RQ2所提出的MVPM融合技术在处理如麻醉车或Mayo托盘等低频或部分遮挡物体时,如何提升分割性能?
  • RQ3一次性校准方法在无需重新校准的情况下,能在多大程度上实现跨不同达芬奇Xi系统的即插即用式部署?
  • RQ4将3D点云数据与2D强度图像结合,是否能带来比纯2D方法更鲁棒、更准确的场景理解?
  • RQ5可用相机视角数量如何影响整体分割性能?增加更多视角是否能带来可测量的性能增益?

主要发现

  • 系统实现了3.3% ± 1.4%的靶标注册误差(TRE),占物体-相机距离的百分比,表明多相机校准具有高度可靠性。
  • 与单视角基线相比,MVPM方法显著提升了低频类别的mIOU:人类+0.013,Mayo托盘+0.020,无菌台+0.015,麻醉车+0.037。
  • MVPM方法在麻醉车上的最终mIOU达到0.711 ± 0.031,在Mayo托盘上达到0.687 ± 0.060,优于DeepLab V3+和Dense 3D CRF基线方法。
  • 消融实验表明,随着相机视角数量增加,分割性能显著提升,4个相机与1个相机对比的p值为4.11E-9,证实了多视角融合的价值。
  • MVPM方法增强了像素级一致性与区域平滑性,成功恢复了在单视角中分割效果差的被部分遮挡物体,如麻醉车。
  • Dense 3D CRF基线未表现出统计显著的性能提升,凸显了所提出的、基于置信度感知的MVPM学习融合机制的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。