Skip to main content
QUICK REVIEW

[论文解读] A real-time spatiotemporal AI model analyzes skill in open surgical videos

Emmett D. Goodman, Krishna Patel|arXiv (Cornell University)|Dec 14, 2021
Surgical Simulation and Training被引用 6
一句话总结

本论文提出了一种基于最大规模公开可用开放手术视频数据集——AVOS——训练的实时时空多任务人工智能模型。该数据集源自全球50个国家、23种手术的YouTube视频。该模型可同时检测双手、器械、动作及手部关键点,并识别与外科技术相关的运动学描述符,展示了其在多样化临床环境中的泛化能力,验证了其通过手部运动效率预测技术水平的能力。

ABSTRACT

Open procedures represent the dominant form of surgery worldwide. Artificial intelligence (AI) has the potential to optimize surgical practice and improve patient outcomes, but efforts have focused primarily on minimally invasive techniques. Our work overcomes existing data limitations for training AI models by curating, from YouTube, the largest dataset of open surgical videos to date: 1997 videos from 23 surgical procedures uploaded from 50 countries. Using this dataset, we developed a multi-task AI model capable of real-time understanding of surgical behaviors, hands, and tools - the building blocks of procedural flow and surgeon skill. We show that our model generalizes across diverse surgery types and environments. Illustrating this generalizability, we directly applied our YouTube-trained model to analyze open surgeries prospectively collected at an academic medical center and identified kinematic descriptors of surgical skill related to efficiency of hand motion. Our Annotated Videos of Open Surgery (AVOS) dataset and trained model will be made available for further development of surgical AI.

研究动机与目标

  • 解决开放手术视频分析中缺乏大规模、多样化数据集的问题。
  • 开发一种实时多任务人工智能模型,能够理解不同环境下的时空外科行为。
  • 从视频数据中识别与临床结局相关的客观、运动学的外科技术描述符。
  • 实现基于公开视频训练的AI模型在学术医学中心前瞻性临床数据上的泛化能力。
  • 发布AVOS数据集与训练好的模型,以加速外科技人工智能研究。

提出的方法

  • 从YouTube平台跨23种手术和50个国家收集并筛选1,997个开放手术视频,构建AVOS数据集。
  • 对343个视频进行标注,包括双手和器械的边界框、21个人体手部关键点,以及时间上的动作标签。
  • 开发一种多任务深度学习模型,采用共享主干网络,联合预测动作、手部与器械检测,以及手部关键点估计。
  • 采用时空建模方法,利用关键点向量之间的L1距离追踪视频帧间手部姿态与运动的变化。
  • 应用线性判别分析从视频序列中提取30个可解释特征,包括随时间变化的动作与器械使用情况及状态转移概率。
  • 通过留一法交叉验证评估模型性能,并在学术医学中心前瞻性收集的数据上测试泛化能力。

实验结果

研究问题

  • RQ1在多样化、公开可用的YouTube视频上训练的多任务AI模型,能否在临床环境中实现对开放手术过程的实时分析?
  • RQ2手部运动的哪些运动学特征与开放手术中外科医生的技术水平相关?
  • RQ3模型性能在不同视频质量、变焦级别和手术类型下如何变化?
  • RQ4该模型能否在复杂的真实手术场景中以高精度与高召回率检测并定位双手、器械与动作?
  • RQ5模型所学习的特征在多大程度上反映了临床上有意义的外科技术描述符?

主要发现

  • AVOS数据集包含来自50个国家的1,997个开放手术视频,其中343个视频完整标注了双手、器械、动作及21个人体手部关键点。
  • 多任务模型在不同视频质量和变焦级别下均表现出高精度与高召回率,工具检测的mAP为0.82,手部检测的mAP为0.85(IOU=0.5)。
  • 该模型在学术医学中心前瞻性收集的数据集上表现出稳健性能,成功识别出外科技术的运动学描述符。
  • 手部运动效率——通过随时间变化的总手部姿态变化量衡量——与外科医生技术水平显著相关,技术更高超的医生表现出更低的运动变异性。
  • 留一法交叉验证显示,当移除单个外科医生时,技能中心分布无显著偏移,表明模型对个体操作者偏差具有鲁棒性。
  • 通过类别激活图验证了模型的可解释性,结果显示手部和器械的近端区域对检测置信度影响最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。