Skip to main content
QUICK REVIEW

[论文解读] ACPL: Anti-curriculum Pseudo-labelling for Semi-supervised Medical Image Classification

Fengbei Liu, Yu Tian|arXiv (Cornell University)|Nov 25, 2021
Infrastructure Maintenance and Monitoring被引用 4
一句话总结

ACPL 提出了一种用于医学图像分类的新型半监督学习方法,通过基于跨分布信息量的无标签样本选择来缓解类别不平衡问题,并利用模型与 KNN 预测的集成及信息量加权的混合方法(informative mixup)来提高伪标签的准确性。该方法在多标签(Chest X-ray14)和多类(ISIC2018)基准上均取得了最先进性能,通过解决确认偏差和训练不平衡问题,且无需为各类别设置特定阈值。

ABSTRACT

Effective semi-supervised learning (SSL) in medical image analysis (MIA) must address two challenges: 1) work effectively on both multi-class (e.g., lesion classification) and multi-label (e.g., multiple-disease diagnosis) problems, and 2) handle imbalanced learning (because of the high variance in disease prevalence). One strategy to explore in SSL MIA is based on the pseudo labelling strategy, but it has a few shortcomings. Pseudo-labelling has in general lower accuracy than consistency learning, it is not specifically designed for both multi-class and multi-label problems, and it can be challenged by imbalanced learning. In this paper, unlike traditional methods that select confident pseudo label by threshold, we propose a new SSL algorithm, called anti-curriculum pseudo-labelling (ACPL), which introduces novel techniques to select informative unlabelled samples, improving training balance and allowing the model to work for both multi-label and multi-class problems, and to estimate pseudo labels by an accurate ensemble of classifiers (improving pseudo label accuracy). We run extensive experiments to evaluate ACPL on two public medical image classification benchmarks: Chest X-Ray14 for thorax disease multi-label classification and ISIC2018 for skin lesion multi-class classification. Our method outperforms previous SOTA SSL methods on both datasets

研究动机与目标

  • 解决半监督医学图像分类中罕见疾病类别存在的类别不平衡问题。
  • 克服传统伪标签方法的局限性,如确认偏差以及对固定置信度阈值的依赖。
  • 实现对多类和多标签医学图像问题的有效半监督学习。
  • 通过将深度模型预测与基于样本信息量作为加权准则的 KNN 分类相结合,提升伪标签的准确性。
  • 通过选择与已标注分布相距较远的无标签样本,实现稳定且均衡的训练过程,促进少数类的学习。

提出的方法

  • 提出一种跨分布样本信息量度量方法,用于识别与已标注锚点集距离较远的无标签样本,优先选择可能属于少数类的样本。
  • 提出信息量加权的混合方法(informative mixup),一种伪标签机制,通过基于锚点集的密度权重,将模型预测与 KNN 预测相结合,以提升标签准确性并减少确认偏差。
  • 设计一种锚点集净化策略,仅选择最具信息量的伪标签样本以更新锚点集,从而在训练周期中提升 KNN 分类器的可靠性。
  • 使用可动态更新的锚点集,通过整合高信息量的伪标签结果,提升后续 KNN 预测的稳定性和准确性。
  • 采用类似课程学习的策略,通过聚焦于信息量高且分布上远离的无标签样本,避免选择简单、多数类样本。
  • 实施一种由样本信息量引导的 KNN 分类器,以提供鲁棒的伪标签,尤其在具有复杂类别关联的多标签设置中表现优异。
(a) Diagram of our ACPL (top) and traditional pseudo-label SSL (bottom)
(a) Diagram of our ACPL (top) and traditional pseudo-label SSL (bottom)

实验结果

研究问题

  • RQ1基于无标签样本与已标注数据的分布距离进行选择,是否能提升在类别不平衡医学图像分类中的模型泛化能力?
  • RQ2结合模型预测与 KNN 分类,并使用信息量加权的混合方法,对伪标签准确率和模型鲁棒性有何影响?
  • RQ3所提出方法在多大程度上缓解了半监督医学图像学习中的确认偏差?
  • RQ4该方法是否能在无需问题特定阈值调优的情况下,泛化应用于多类与多标签医学图像基准?
  • RQ5锚点集净化机制是否提升了基于 KNN 的伪标签组件的稳定性和性能?

主要发现

  • 在仅使用 2% 标注数据的多标签 Chest X-ray14 数据集上,ACPL 的测试 AUC 达到 74.44,优于以往最先进方法。
  • 在多类 ISIC2018 基准上,ACPL 达到了最先进性能,证明了其在不同类型问题上的有效性。
  • 信息量加权的混合方法使伪标签准确率相比基线方法(包括仅模型、仅 KNN 和随机 alpha 混合)至少提升 1.5%。
  • 基于信息量的样本选择显著降低了少数类与多数类之间的样本比例差异,将少数类样本占比从 5–10% 提升至接近 30%。
  • 锚点集净化机制显著提升了性能稳定性,将 AUC 方差从 2% 降低至 1%,且在不同 KNN 邻居数下表现更一致。
  • 消融实验表明,信息量样本选择与信息量加权混合机制均为性能提升的关键因素,两者对最终准确率均有显著贡献。
(b) Imbalanced distribution on multi-label Chest X-ray14 [ 39 ] (left) and multi-class ISIC2018 [ 36 ] (right)
(b) Imbalanced distribution on multi-label Chest X-ray14 [ 39 ] (left) and multi-class ISIC2018 [ 36 ] (right)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。