Skip to main content
QUICK REVIEW

[论文解读] Data Splits and Metrics for Method Benchmarking on Surgical Action Triplet Datasets

Chinedu Innocent Nwoye, Nicolas Padoy|arXiv (Cornell University)|Apr 11, 2022
Surgical Simulation and Training参考文献 19被引用 12
一句话总结

本文为 CholecT45 和 CholecT50 手术动作三元组数据集引入了标准化的数据划分方式和评估指标,实现了深度学习模型在手术活动识别任务中的稳定基准测试。研究提出了 k 折交叉验证划分以实现公平的模型比较,开发了开源的 ivtmetrics 库用于三元组评估,并发布了基于 PyTorch 和 TensorFlow 的可复现模型,显著提升了该领域内模型可比性与研究进展的可追踪性。

ABSTRACT

In addition to generating data and annotations, devising sensible data splitting strategies and evaluation metrics is essential for the creation of a benchmark dataset. This practice ensures consensus on the usage of the data, homogeneous assessment, and uniform comparison of research methods on the dataset. This study focuses on CholecT50, which is a 50 video surgical dataset that formalizes surgical activities as triplets of . In this paper, we introduce the standard splits for the CholecT50 and CholecT45 datasets and show how they compare with existing use of the dataset. CholecT45 is the first public release of 45 videos of CholecT50 dataset. We also develop a metrics library, ivtmetrics, for model evaluation on surgical triplets. Furthermore, we conduct a benchmark study by reproducing baseline methods in the most predominantly used deep learning frameworks (PyTorch and TensorFlow) to evaluate them using the proposed data splits and metrics and release them publicly to support future research. The proposed data splits and evaluation metrics will enable global tracking of research progress on the dataset and facilitate optimal model selection for further deployment.

研究动机与目标

  • 为 CholecT45 和 CholecT50 数据集建立一致且可复现的数据划分方式,以实现对手术动作三元组识别方法的公平比较。
  • 定义并标准化三元组检测与识别的评估指标,解决以往基准测试实践中存在的不一致性问题。
  • 开发并发布一个公开的、模块化的指标库(ivtmetrics),支持 PyTorch 和 TensorFlow 等深度学习框架使用。
  • 在所提出的划分上重新实现并评估最先进模型,为未来研究提供可靠的基线参考。
  • 通过标准化评估协议,支持长期研究进展追踪与临床部署中的最优模型选择。

提出的方法

  • 提出两种主要数据划分方式:一种是与先前发表工作一致的标准训练/验证/测试划分;另一种是 k 折交叉验证划分,以缓解类别不平衡问题并提升泛化能力评估的可靠性。
  • 在 CholecT45 和 CholecT50 上引入严格的 k 折交叉验证策略,确保所有数据点均被充分评估,同时降低性能估计的方差。
  • 设计并实现 ivtmetrics Python 库,用于评估三元组识别与定位任务,支持检测与分类指标,并在不同框架间实现标准化。
  • 在 PyTorch 和 TensorFlow 中重新实现现有的最先进手术三元组识别模型,以确保可复现性与跨框架兼容性。
  • 将标准化的指标与划分应用于多次运行的模型评估,确保性能报告的一致性与可比性。
  • 通过 GitHub 和公开数据集发布训练好的模型、代码、权重以及 ivtmetrics 库,以促进透明度与复用。

实验结果

研究问题

  • RQ1在 CholecT45 和 CholecT50 数据集上,用于基准测试手术动作三元组识别的最有效且可复现的数据划分方式是什么?
  • RQ2如何实现评估指标的标准化,以确保不同研究团队之间模型比较的公平性与一致性?
  • RQ3在标准化的数据划分与评估指标下,使用最先进模型可达到怎样的性能表现?
  • RQ4与单次测试集划分相比,k 折交叉验证在该数据集上如何提升模型评估的可靠性?
  • RQ5所提出的指标库在多大程度上实现了跨深度学习框架的一致性与可复用性评估?

主要发现

  • 在 CholecT45 和 CholecT50 上提出的 k 折交叉验证划分通过减少方差和缓解类别不平衡问题,显著提升了模型评估的稳健性与泛化能力。
  • ivtmetrics 库实现了在 PyTorch 和 TensorFlow 框架之间对手术三元组识别模型的一致性、模块化与可复用评估。
  • 在标准化划分上复现的模型在 CholecT50 上取得平均 F1 分数为 29.4±2.8,在 CholecT45 上为 29.4±2.5,为未来比较提供了可靠基线。
  • 基准研究揭示,不同三元组类别间的性能差异显著,部分类别表现优异(如 'irrigator,irrigate,cystic-pedicle' 的 F1 分数达 94.0±4.6),而另一些类别则表现极低(如 'bipolar,grasp,cystic-plate' 的 F1 分数仅为 0.5±0.1),凸显了类别特异性挑战。
  • 标准化的划分与评估指标使研究进展得以持续追踪,使用相同协议的研究结果现在具备可比性。
  • 代码、模型与指标库的发布确保了研究的可复现性,并加速了未来在手术动作识别领域的研究进程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。