[论文解读] Cluster-Based Learning from Weakly Labeled Bags in Digital Pathology
该论文提出CCE+,一种仅使用图像级别标签的弱监督学习方法,用于在全切片图像中检测肿瘤转移。通过使用变分自编码器对切片特征进行聚类,并将基于聚类的伪标签整合到混合交叉熵损失中,CCE+在Camelyon数据集上实现了与全监督训练相当的性能,即使在极端类别不平衡和噪声弱标签的情况下亦是如此。
To alleviate the burden of gathering detailed expert annotations when training deep neural networks, we propose a weakly supervised learning approach to recognize metastases in microscopic images of breast lymph nodes. We describe an alternative training loss which clusters weakly labeled bags in latent space to inform relevance of patch-instances during training of a convolutional neural network. We evaluate our method on the Camelyon dataset which contains high-resolution digital slides of breast lymph nodes, where labels are provided at the image-level and only subsets of patches are made available during training.
研究动机与目标
- 减少在训练数字病理学深度学习模型时对昂贵且详细的专家标注的依赖。
- 解决全切片图像分析中的极端类别不平衡问题,其中正样本(肿瘤)切片不足5%。
- 通过在潜在空间中对切片特征进行无监督聚类,提升模型从弱标签中学习的能力。
- 设计一种损失函数,将传统分类交叉熵与基于聚类的伪标签类别结合,以指导训练。
- 证明弱监督学习可在组织病理学图像分析中实现接近全监督方法的性能。
提出的方法
- 在135,000个切片上无监督预训练变分自编码器(VAE),以学习高斯潜在表示。
- 对VAE学习到的潜在空间应用K-means聚类,识别出具有相似外观和纹理的K个切片实例簇。
- 通过簇内切片的弱图像级别标签进行多数投票,为每个簇分配簇类别标签(C^i)。
- 对于每个切片,最近的簇中心决定其在特征空间中的估计簇类别标签(ŷ)。
- 混合损失函数CCE+将标准分类交叉熵(CCE)与预测和簇类别之间的CCE结合:L = α·CCE(y,p) + (1−α)·CCE(ŷ,p),其中α=0.5。
- 使用该损失函数训练InceptionNet分类器,通过小批量采样切片,确保训练袋中癌变组织和健康组织的表示保持平衡。
实验结果
研究问题
- RQ1仅使用图像级别标签的弱监督学习方法是否能在全切片图像分析中实现与全监督训练相当的性能?
- RQ2在潜在空间中引入切片特征的无监督聚类,如何改善从噪声大、弱标签数据中的学习?
- RQ3所提出的CCE+损失函数是否能缓解数字病理学数据集中极端类别不平衡的负面影响?
- RQ4当训练数据包含大量干扰性(非肿瘤)切片时,模型是否仍能保持鲁棒性?
- RQ5VAE学习到的特征在无专家标注的情况下,能在多大程度上捕捉到生物相关的组织模式?
主要发现
- 在Camelyon 2016数据集上,CCE+在测试集上达到0.947的AUC,与全监督模型性能相当。
- 该方法优于使用弱标签的标准分类交叉熵(CCE),尤其在较高敏感度水平下,表明泛化能力得到提升。
- 当α=0.5时,混合损失在来自袋级别标签和簇类别的信息之间达到平衡,实现最优性能。
- VAE潜在空间的t-SNE可视化显示肿瘤和健康切片实例之间存在清晰分离,表明无需标注即可实现有效的特征学习。
- 在100个簇和α=0.5时,CCE+在不同袋大小下均保持高精度,显示出对数据分布变化的鲁棒性。
- 即使每张WSI仅使用100个切片(占总数的10%)进行训练,CCE+仍保持强劲性能,证明其在低数据场景下的高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。