[论文解读] DeepPhase: Surgical Phase Recognition in CATARACTS Videos
该论文提出DeepPhase,一种用于白内障手术视频中自动手术阶段识别的深度学习框架,采用ResNet进行器械检测,利用RNN(LSTM/GRU)建模时间阶段转换。在使用器械特征进行阶段识别时,准确率达到78.28%,展现出最先进的性能,具备稳健的时间建模能力,且器械检测AUC高达97.69%。
Automated surgical workflow analysis and understanding can assist surgeons to standardize procedures and enhance post-surgical assessment and indexing, as well as, interventional monitoring. Computer-assisted interventional (CAI) systems based on video can perform workflow estimation through surgical instruments' recognition while linking them to an ontology of procedural phases. In this work, we adopt a deep learning paradigm to detect surgical instruments in cataract surgery videos which in turn feed a surgical phase inference recurrent network that encodes temporal aspects of phase steps within the phase classification. Our models present comparable to state-of-the-art results for surgical tool detection and phase recognition with accuracies of 99 and 78% respectively.
研究动机与目标
- 开发一种用于白内障手术视频中自动手术阶段识别的系统,以支持术中决策与术后分析。
- 通过将器械检测与循环神经网络相结合,解决手术流程中时间建模的挑战。
- 利用ResNet提取的深度特征与LSTM及GRU架构的序列建模,提升阶段识别准确率。
- 在未见视频上评估泛化性能,并分析类别不平衡与阶段转换噪声对模型的影响。
- 提供一种可扩展的端到端解决方案,适用于临床与教学环境中的手术流程分析。
提出的方法
- 使用残差神经网络(ResNet)从视频帧中提取深度特征以进行手术器械检测,当器械接触眼球时标注为存在。
- 使用具有LSTM或GRU单元的循环神经网络(RNN)处理器械特征序列,以推断手术阶段,建模帧间的时间依赖性。
- 以滑动窗口方式处理100帧的输入序列(约33秒),实现在时间上的连续阶段分类。
- 使用二值存在向量与ResNet提取的深度特征嵌入作为RNN的输入,后者在LSTM模型中表现更优。
- 使用Adam优化器进行模型训练,固定初始学习率为0.001,动量参数β₁=0.9与β₂=0.999,训练4个周期。
- 阶段标注由临床专家完成,定义了白内障手术中的14个不同阶段,包括囊膜撕囊、超声乳化及人工晶体植入等关键步骤。
实验结果
研究问题
- RQ1仅使用视频与器械存在标注,深度学习模型能否在手术阶段识别中实现高准确率?
- RQ2与二值器械存在输入相比,使用ResNet提取的深度特征表示在提升阶段识别性能方面有何优势?
- RQ3LSTM与GRU架构在不同手术阶段(尤其是训练样本较少的阶段)上的泛化能力如何?
- RQ4模型在未见测试视频上的表现如何?哪些因素会影响其泛化能力,如类别不平衡或阶段转换?
- RQ5通过RNN进行时间建模是否能有效捕捉白内障手术中手术流程的序列特性?
主要发现
- 当使用ResNet深度特征时,LSTM模型在保留测试集上达到78.28%的准确率,优于二值输入及其他配置。
- GRU模型在训练集上使用二值输入时达到89.98%的准确率,但在测试集上性能下降至71.61%,表明存在过拟合或对输入类型敏感。
- 使用深度特征训练的LSTM模型在验证集上达到92.05%的准确率,在测试集上达到78.28%,展现出优异的泛化能力与鲁棒性。
- 模型性能显著受类别不平衡影响,尤其是罕见阶段如ICL(粘弹剂注射)与ICL(晶状体移除)仅出现在两段视频中。
- 在阶段转换期间或器械缺失时,误预测较为常见,凸显了时间边界检测的挑战。
- 在CATARACTS测试集上,器械检测AUC达到97.69%,表明在识别手术视野中器械存在方面具有高度可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。