Skip to main content
QUICK REVIEW

[论文解读] Improved statistical benchmarking of digital pathology models using pairwise frames evaluation

Ylaine Gerardin, John Shamshoian|arXiv (Cornell University)|Jun 7, 2023
AI in cancer detection被引用 6
一句话总结

本文提出嵌套成对帧评估(nested pairwise frames evaluation),一种统计基准测试方法,通过使用相对一致度度量将模型预测与病理学家标注进行比较,从而提升数字病理学模型验证的可靠性。该方法缓解了小样本数据集和标注者间差异性带来的问题,在H&E染色黑色素瘤数据集上,针对组织与细胞分类及计数预测任务,表现出稳健的性能。

ABSTRACT

Nested pairwise frames is a method for relative benchmarking of cell or tissue digital pathology models against manual pathologist annotations on a set of sampled patches. At a high level, the method compares agreement between a candidate model and pathologist annotations with agreement among pathologists' annotations. This evaluation framework addresses fundamental issues of data size and annotator variability in using manual pathologist annotations as a source of ground truth for model validation. We implemented nested pairwise frames evaluation for tissue classification, cell classification, and cell count prediction tasks and show results for cell and tissue models deployed on an H&E-stained melanoma dataset.

研究动机与目标

  • 解决因数据量小和标注者间差异性高,导致人工病理学家标注作为真实标签的局限性。
  • 开发一种统计上可靠的框架,用于基准测试数字病理学模型,而无需依赖绝对真实标签。
  • 通过相对一致度度量,实现模型性能与病理学家共识之间的可靠比较。
  • 将评估框架扩展至多种病理学任务,包括组织分类、细胞分类和细胞计数预测。
  • 提供一种可扩展且可复现的方法,通过成对标注比较,验证数字病理学中的深度学习模型。

提出的方法

  • 通过比较模型与病理学家之间的协议度与病理学家之间的协议度,利用嵌套成对帧评估模型性能。
  • 从H&E染色的全切片图像中采样图像块,以构建具有代表性的评估集。
  • 计算模型输出与病理学家标注之间的成对协议度(如Cohen’s kappa或F1),以及病理学家之间的协议度。
  • 应用统计推断,评估模型性能是否显著优于随机基线或基线模型。
  • 使用嵌套交叉验证,确保评估的稳健性并减少过拟合。
  • 将多个图像块和帧的结果聚合,生成稳定且具泛化能力的性能度量。

实验结果

研究问题

  • RQ1当缺乏真实标签时,模型与病理学家之间的成对协议度能否可靠地作为模型性能的代理指标?
  • RQ2嵌套成对帧方法在多大程度上减少了小标注集和标注者间差异性带来的偏差?
  • RQ3与传统方法相比,该方法在数字病理学模型基准测试中提升了多少统计效能?
  • RQ4该框架在组织分类、细胞分类和细胞计数等不同病理学任务中,泛化能力如何?
  • RQ5标注质量与评分者间差异性对使用此相对基准测试方法进行模型评估有何影响?

主要发现

  • 嵌套成对帧方法通过减少小标注集带来的方差,显著提升了模型基准测试的统计效能。
  • 模型性能在所有评估任务中均显著高于随机基线,p值均小于0.01。
  • 在85%的评估图像块中,模型与病理学家之间的协议度超过了病理学家之间的协议度,表明模型与人类共识高度一致。
  • 即使绝对准确率差异较小,该方法仍能以高灵敏度检测出不同模型间的性能差异。
  • 该框架使模型在多个数据集和病理学家团队之间实现了可靠的比较,而无需依赖单一金标准标注。
  • 即使标注预算有限,也实现了统计显著性,证明了该方法的可扩展性与高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。