[论文解读] Using Computer Vision to Automate Hand Detection and Tracking of Surgeon Movements in Videos of Open Surgery
本文提出一种基于RetinaNet的卷积神经网络计算机视觉方法,用于在开放手术视频中自动检测和追踪外科医生的手部。该模型在多样化的公开YouTube手术视频数据集上进行训练,手部边界框已做标注,显著优于以往在手术数据上的手部检测模型,实现了准确且时序一致的手部追踪,从而支持对手术动作模式和动作经济性的评估。
Open, or non-laparoscopic surgery, represents the vast majority of all operating room procedures, but few tools exist to objectively evaluate these techniques at scale. Current efforts involve human expert-based visual assessment. We leverage advances in computer vision to introduce an automated approach to video analysis of surgical execution. A state-of-the-art convolutional neural network architecture for object detection was used to detect operating hands in open surgery videos. Automated assessment was expanded by combining model predictions with a fast object tracker to enable surgeon-specific hand tracking. To train our model, we used publicly available videos of open surgery from YouTube and annotated these with spatial bounding boxes of operating hands. Our model's spatial detections of operating hands significantly outperforms the detections achieved using pre-existing hand-detection datasets, and allow for insights into intra-operative movement patterns and economy of motion.
研究动机与目标
- 为解决开放手术表现评估缺乏客观、可扩展工具的问题,目前该领域仍主要依赖主观的专家评审。
- 开发一种鲁棒的自动化系统,利用计算机视觉技术在开放手术视频中检测并追踪外科医生的手部。
- 克服真实手术视频中因手部形变、遮挡以及成像条件多变带来的手部检测挑战。
- 通过时序一致的手部追踪,支持对手术动作模式和动作经济性的下游分析。
- 证明在多样化、公开可用的手术视频上进行训练的模型,可在手术领域中超越在通用手部检测数据集上训练的模型表现。
提出的方法
- 采用基于RetinaNet的单阶段目标检测器,并引入焦点损失(focal loss),用于在单帧图像中进行空间手部检测。
- 从YouTube收集了一个大规模且多样化的开放手术视频数据集,并对手术中使用的手部进行空间边界框标注。
- 该模型仅在自建的手术视频数据集上进行训练,未使用通用手部检测数据集。
- 将每帧的检测结果输入SORT(Simple Online and Realtime Tracking)算法,生成时序一致、专属手部的轨迹。
- 该系统可实现视频序列中手部的专属追踪,支持对手术动作模式和操作灵巧度的分析。
- 从追踪输出生成轨迹图,用于可视化和解读手术过程中手部运动的动力学特征。
实验结果
研究问题
- RQ1在公开可用的开放手术视频上进行训练的深度学习模型,是否能在手部检测性能上优于在通用手部检测数据集上训练的模型?
- RQ2在开放手术视频中,自动化手部检测与追踪在多大程度上能支持对手术动作模式和动作经济性的客观评估?
- RQ3先进目标检测器与实时追踪器的结合,在复杂手术视频序列中保持手部身份识别的可靠性如何?
- RQ4该模型学习了哪些视觉和上下文线索,使其在遮挡、光照变化和形变情况下仍能实现鲁棒检测?
- RQ5生成的轨迹图是否能提供与专家手术评估一致的洞察?
主要发现
- 所提出的模型在开放手术视频上的手部检测性能显著优于在现有手部检测数据集上训练的模型,展现出领域特定的泛化能力。
- 该模型在多种复杂条件下成功检测到手部,包括特写镜头、遮挡、光照变化以及单帧中存在多只手的情况。
- 主要错误类型为误报,常将形状和位置类似手部的物体(如手术布单)错误分类为手部。
- RetinaNet检测与SORT追踪的结合,生成了时序一致、专属手部的轨迹,支持对手术动作模式的有意义分析。
- 轨迹图揭示了不同的运动特征:组织切除过程中动作稳定,缝合过程中动作高效且平滑,与专家评估结果一致。
- 该系统能够通过细微的手指调整识别出高灵巧度,凸显了在复杂任务中对手部精细运动控制的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。