[论文解读] Deep Learning with Permutation-invariant Operator for Multi-instance Histopathology Classification
本文提出一种基于排列不变算子的深度学习框架,用于多实例组织病理学分类,通过共享神经网络聚合切片级预测结果。该方法在小型乳腺癌数据集上实现了具有竞争力的性能(AUC:0.88–0.90),其中噪声或(Noisy-Or)算子在所测试算子中表现最佳。
The computer-aided analysis of medical scans is a longstanding goal in the medical imaging field. Currently, deep learning has became a dominant methodology for supporting pathologists and radiologist. Deep learning algorithms have been successfully applied to digital pathology and radiology, nevertheless, there are still practical issues that prevent these tools to be widely used in practice. The main obstacles are low number of available cases and large size of images (a.k.a. the small n, large p problem in machine learning), and a very limited access to annotation at a pixel level that can lead to severe overfitting and large computational requirements. We propose to handle these issues by introducing a framework that processes a medical image as a collection of small patches using a single, shared neural network. The final diagnosis is provided by combining scores of individual patches using a permutation-invariant operator (combination). In machine learning community such approach is called a multi-instance learning (MIL).
研究动机与目标
- 通过弱监督学习解决数字病理学中小样本数据和高分辨率医学图像带来的挑战。
- 克服因图像尺寸过大和像素级标注有限导致的过拟合与计算负担。
- 开发一个端到端可训练模型,将全切片图像作为共享特征提取的切片集合进行处理。
- 引入排列不变组合算子,将切片级得分聚合为袋级诊断结果。
- 通过数据增强和可微算子(如噪声或、ISR和LSE)提升泛化能力和诊断相关性。
提出的方法
- 将全切片组织病理学图像划分为非重叠的96×96像素切片以进行处理。
- 应用共享的深度神经网络(含卷积层和全连接层,以及Dropout)提取切片级得分。
- 使用排列不变算子——噪声或、ISR和对数求和指数(Log-Sum-Exp)——将切片得分组合为袋级概率。
- 通过反向传播端到端训练模型,最小化袋级标签的负对数似然。
- 使用伯努利分布建模袋标签概率,其条件依赖于排列不变算子的输出。
- 应用广泛的数据增强,包括H&E染色色度抖动、随机旋转/镜像和高斯模糊,以减少过拟合。
实验结果
研究问题
- RQ1仅使用全切片标签而无需像素级标注,深度学习模型能否有效分类组织病理学图像?
- RQ2在弱监督组织病理学分类中,不同排列不变算子(噪声或、ISR、LSE)的性能表现如何比较?
- RQ3在小样本医学影像场景中,使用可微算子的端到端训练是否优于传统多实例学习方法?
- RQ4数据增强在低资源组织病理学分类中在多大程度上提升了泛化能力?
- RQ5基于切片的深度学习框架能否缓解大尺寸全切片图像中的过拟合与计算成本问题?
主要发现
- 所提出的DeepNOR-MIL在所有测试的深度学习变体中取得了最高准确率(0.879)和F1分数(0.873)。
- DeepISR-MIL实现了最高AUC(0.90),优于关系型GPMIL基线(AUC:0.90),并达到最佳性能方法的水平。
- DeepLSE-MIL表现出较差的精确率和召回率(分别为0.833和0.192),表明尽管AUC较高(0.88),其学习过程仍不稳定。
- 噪声或算子在各项指标上表现最为一致,表明其最适用于本任务。
- 所有深度多实例学习模型的AUC值均在0.88至0.90之间,与最先进的基于高斯过程的多实例学习方法相当。
- 数据增强显著提升了模型的鲁棒性,尤其在训练数据有限且H&E染色差异较大的情况下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。