[论文解读] Mitosis domain generalization in histopathology images -- The MIDOG challenge
本论文介绍了 MIDOG 2021 挑战赛,该赛事评估了在多种全切片扫描仪上进行组织病理学图像有丝分裂检测的域泛化方法。优胜方法在未见过的扫描仪上实现了 0.748 的 F₁ 分数(95% 置信区间:0.704–0.781),展现出最先进的性能,其中模型集成、测试时增强以及辅助分割任务被证明是关键成功因素。
The density of mitotic figures within tumor tissue is known to be highly correlated with tumor proliferation and thus is an important marker in tumor grading. Recognition of mitotic figures by pathologists is known to be subject to a strong inter-rater bias, which limits the prognostic value. State-of-the-art deep learning methods can support the expert in this assessment but are known to strongly deteriorate when applied in a different clinical environment than was used for training. One decisive component in the underlying domain shift has been identified as the variability caused by using different whole slide scanners. The goal of the MICCAI MIDOG 2021 challenge has been to propose and evaluate methods that counter this domain shift and derive scanner-agnostic mitosis detection algorithms. The challenge used a training set of 200 cases, split across four scanning systems. As a test set, an additional 100 cases split across four scanning systems, including two previously unseen scanners, were given. The best approaches performed on an expert level, with the winning algorithm yielding an F_1 score of 0.748 (CI95: 0.704-0.781). In this paper, we evaluate and compare the approaches that were submitted to the challenge and identify methodological factors contributing to better performance.
研究动机与目标
- 解决数字组织病理学中因全切片扫描仪差异导致的有丝分裂检测域偏移问题。
- 开发对扫描仪无感的深度学习模型,实现在不同成像设备间的泛化。
- 在包含两个训练中未见的扫描仪的基准数据集上评估方法。
- 识别能够实现在多样化扫描仪域中稳健性能的方法学因素。
- 通过减少观察者间差异和扫描仪依赖的性能下降,推动人工智能在肿瘤分级中的临床应用。
提出的方法
- 挑战赛使用了来自四种全切片扫描仪的 200 例训练数据和 100 例测试数据,其中包含两个在训练中未出现过的扫描仪。
- 参赛者应用深度学习模型进行有丝分裂检测,许多方法采用了测试时增强和模型集成以提升鲁棒性。
- 表现最佳的方法引入了辅助分割任务,以增强特征学习和泛化能力。
- 通过所有扫描仪的 F₁ 分数对模型进行评估,特别关注在未知扫描仪上的表现。
- 评估框架通过控制染色条件,将扫描仪引起的域偏移作为主要挑战进行隔离。
- 对结果进行分析,以识别影响域泛化的模型架构、数据增强和训练策略的趋势。
实验结果
研究问题
- RQ1深度学习模型能否在多个全切片扫描仪(包括训练中未见的扫描仪)上实现稳健的有丝分裂检测性能?
- RQ2哪些方法学组件——如模型集成、测试时增强或辅助任务——最显著地提升了有丝分裂检测中的域泛化能力?
- RQ3与染色或组织类型等其他变异源相比,扫描仪差异引起的域偏移在多大程度上影响了模型性能?
- RQ4在区域感兴趣(ROI)图像块上的模型性能在多大程度上能泛化到组织复杂度更高的全切片图像?
- RQ5模型架构的大小和设计在实现多样化扫描仪域泛化方面起到了什么作用?
主要发现
- 表现最佳的方法实现了 0.748 的 F₁ 分数(95% 置信区间:0.704–0.781),在相同任务上达到与专家病理科医生相当的性能水平。
- 所有三个表现最佳的方法均使用了辅助分割任务,表明其可能有助于域泛化,但因果关系尚无法确认。
- 七种表现最佳方法中的五种使用了模型集成或测试时增强,表明这些策略是提升鲁棒性的关键贡献因素。
- 模型在扫描仪 D 和 F 上的表现显著较弱——尤其是当标签未提供时——表明存在未被捕捉的域偏移或图像质量问题。
- 更大的分类网络与更好的性能相关联,表明架构容量可能有助于泛化。
- 该挑战赛表明,全切片扫描仪引起的域偏移是一个主要但可克服的障碍,顶尖方法在未见过的扫描仪上实现了最先进的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。