Skip to main content
QUICK REVIEW

[论文解读] DeepPhase: Surgical Phase Recognition in CATARACTS Videos

Odysseas Zisimopoulos, Evangello Flouty|arXiv (Cornell University)|Jul 17, 2018
Surgical Simulation and Training被引用 11
一句话总结

该论文提出DeepPhase,一种用于白内障手术视频中自动手术阶段识别的深度学习框架,采用ResNet进行器械检测,利用RNN(LSTM/GRU)建模时间阶段转换。在使用器械特征进行阶段识别时,准确率达到78.28%,展现出最先进的性能,具备稳健的时间建模能力,且器械检测AUC高达97.69%。

ABSTRACT

Automated surgical workflow analysis and understanding can assist surgeons to standardize procedures and enhance post-surgical assessment and indexing, as well as, interventional monitoring. Computer-assisted interventional (CAI) systems based on video can perform workflow estimation through surgical instruments' recognition while linking them to an ontology of procedural phases. In this work, we adopt a deep learning paradigm to detect surgical instruments in cataract surgery videos which in turn feed a surgical phase inference recurrent network that encodes temporal aspects of phase steps within the phase classification. Our models present comparable to state-of-the-art results for surgical tool detection and phase recognition with accuracies of 99 and 78% respectively.

研究动机与目标

  • 开发一种用于白内障手术视频中自动手术阶段识别的系统,以支持术中决策与术后分析。
  • 通过将器械检测与循环神经网络相结合,解决手术流程中时间建模的挑战。
  • 利用ResNet提取的深度特征与LSTM及GRU架构的序列建模,提升阶段识别准确率。
  • 在未见视频上评估泛化性能,并分析类别不平衡与阶段转换噪声对模型的影响。
  • 提供一种可扩展的端到端解决方案,适用于临床与教学环境中的手术流程分析。

提出的方法

  • 使用残差神经网络(ResNet)从视频帧中提取深度特征以进行手术器械检测,当器械接触眼球时标注为存在。
  • 使用具有LSTM或GRU单元的循环神经网络(RNN)处理器械特征序列,以推断手术阶段,建模帧间的时间依赖性。
  • 以滑动窗口方式处理100帧的输入序列(约33秒),实现在时间上的连续阶段分类。
  • 使用二值存在向量与ResNet提取的深度特征嵌入作为RNN的输入,后者在LSTM模型中表现更优。
  • 使用Adam优化器进行模型训练,固定初始学习率为0.001,动量参数β₁=0.9与β₂=0.999,训练4个周期。
  • 阶段标注由临床专家完成,定义了白内障手术中的14个不同阶段,包括囊膜撕囊、超声乳化及人工晶体植入等关键步骤。

实验结果

研究问题

  • RQ1仅使用视频与器械存在标注,深度学习模型能否在手术阶段识别中实现高准确率?
  • RQ2与二值器械存在输入相比,使用ResNet提取的深度特征表示在提升阶段识别性能方面有何优势?
  • RQ3LSTM与GRU架构在不同手术阶段(尤其是训练样本较少的阶段)上的泛化能力如何?
  • RQ4模型在未见测试视频上的表现如何?哪些因素会影响其泛化能力,如类别不平衡或阶段转换?
  • RQ5通过RNN进行时间建模是否能有效捕捉白内障手术中手术流程的序列特性?

主要发现

  • 当使用ResNet深度特征时,LSTM模型在保留测试集上达到78.28%的准确率,优于二值输入及其他配置。
  • GRU模型在训练集上使用二值输入时达到89.98%的准确率,但在测试集上性能下降至71.61%,表明存在过拟合或对输入类型敏感。
  • 使用深度特征训练的LSTM模型在验证集上达到92.05%的准确率,在测试集上达到78.28%,展现出优异的泛化能力与鲁棒性。
  • 模型性能显著受类别不平衡影响,尤其是罕见阶段如ICL(粘弹剂注射)与ICL(晶状体移除)仅出现在两段视频中。
  • 在阶段转换期间或器械缺失时,误预测较为常见,凸显了时间边界检测的挑战。
  • 在CATARACTS测试集上,器械检测AUC达到97.69%,表明在识别手术视野中器械存在方面具有高度可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。