Skip to main content
QUICK REVIEW

[论文解读] Surgical Visual Domain Adaptation: Results from the MICCAI 2020 SurgVisDom Challenge

Aneeq Zia, Kiran Bhattacharyya|arXiv (Cornell University)|Feb 26, 2021
Generative Adversarial Networks and Image Synthesis参考文献 44被引用 13
一句话总结

本论文展示了MICCAI 2020年SurgVisDom挑战赛的结果,该挑战赛通过在虚拟现实(VR)模拟数据上训练模型,并在类临床的猪模型视频上测试,研究了外科视频分析中的视觉域自适应问题。主要发现是,即使仅使用少量类临床数据,也能显著提升模型的泛化能力,优于仅在VR数据上训练的模型。

ABSTRACT

Surgical data science is revolutionizing minimally invasive surgery by enabling context-aware applications. However, many challenges exist around surgical data (and health data, more generally) needed to develop context-aware models. This work - presented as part of the Endoscopic Vision (EndoVis) challenge at the Medical Image Computing and Computer Assisted Intervention (MICCAI) 2020 conference - seeks to explore the potential for visual domain adaptation in surgery to overcome data privacy concerns. In particular, we propose to use video from virtual reality (VR) simulations of surgical exercises in robotic-assisted surgery to develop algorithms to recognize tasks in a clinical-like setting. We present the performance of the different approaches to solve visual domain adaptation developed by challenge participants. Our analysis shows that the presented models were unable to learn meaningful motion based features form VR data alone, but did significantly better when small amount of clinical-like data was also made available. Based on these results, we discuss promising methods and further work to address the problem of visual domain adaptation in surgical data science. We also release the challenge dataset publicly at https://www.synapse.org/surgvisdom2020.

研究动机与目标

  • 解决因隐私和数据共享限制导致的公开外科数据集有限的问题。
  • 探索机器人辅助外科的虚拟现实(VR)模拟是否可作为在真实临床环境中学习外科任务识别的替代方法。
  • 评估视觉域自适应技术在将知识从VR域迁移到类临床外科视频域方面的有效性。
  • 比较仅在纯VR数据上训练的模型(硬域自适应)与使用少量临床数据进行微调的模型(软域自适应)的性能差异。

提出的方法

  • 在MICCAI 2020年内窥镜视觉(EndoVis)竞赛中组织挑战赛,以评估外科视频分析中的视觉域自适应方法。
  • 提供两种训练方案:一种仅使用VR视频(硬域自适应),另一种结合VR视频与少量猪模型视频(软域自适应)。
  • 所有参赛方案均采用3D卷积神经网络(3D-CNNs)作为核心架构,预处理和特征提取方式有所不同。
  • 使用da Vinci外科模拟器的数据(VR)和真实猪模型的数据,视频帧率不同(60 fps VR,20 fps 猪模型),分辨率也不同。
  • 采用标准的视频动作识别指标进行评估,包括加权与非加权F1分数、全局F1分数和平衡准确率。
  • 部分参赛方案应用了工具检测和光流估计等预处理技术,且所有模型均在Kinetics数据集上进行预训练以提升特征学习能力。

实验结果

研究问题

  • RQ1仅在虚拟现实(VR)外科模拟数据上训练的模型能否泛化到真实类临床外科视频域?
  • RQ2在训练中加入少量真实类临床视频数据,能在多大程度上提升外科任务识别在不同域之间的性能?
  • RQ3不同的深度学习架构和预处理策略(如工具检测、光流)如何影响外科视频分析中的域自适应性能?
  • RQ4在不同外科任务中,仅在纯VR数据上训练的模型与使用有限临床数据进行微调的模型之间性能差异如何?
  • RQ5类别不平衡和数据集大小如何影响外科视觉域自适应中的模型泛化能力?

主要发现

  • 在纯VR数据上训练的模型(类别2)表现仅略好于随机基线,表明其在类临床域上的泛化能力较差。
  • 即使在训练中仅加入约10%的类临床猪模型视频(类别1),所有指标的性能均显著提升,表现最佳的团队(Parakeet)达到了0.559的平衡准确率。
  • 所有团队在类别1中的表现均优于随机预测,表明VR与临床数据的结合能够学习到可迁移的特征。
  • 在切开任务中性能最为稳定,而打结和穿针任务表现较低,这与这些类别训练样本较少有关。
  • 团队Parakeet在平衡准确率(0.559)和全局F1分数(0.475)上均表现最佳,尤其在切开和穿针任务中优势明显。
  • 在类别1中,Kinetics预训练和工具检测预处理显著提升了性能,但在类别2中未取得类似提升,表明在缺乏真实数据的情况下,域偏移仍是主要挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。