Skip to main content
QUICK REVIEW

[论文解读] Cost-Sensitive Active Learning for Intracranial Hemorrhage Detection

Weicheng Kuo, Christian Häne|arXiv (Cornell University)|Sep 8, 2018
Machine Learning and Algorithms参考文献 10被引用 9
一句话总结

本文提出了一种针对颅内出血检测的成本敏感主动学习框架,结合基于委员会的不确定性估计与学习到的标注时间预测,以优化标注投资回报率。通过建模可变的标注时间并求解预算约束下的0-1背包问题以实现最优选择,该方法在标注池集上的堆栈级平均精度较均匀成本主动学习高出10%,同时内存占用更低、运行速度更快。

ABSTRACT

Deep learning for clinical applications is subject to stringent performance requirements, which raises a need for large labeled datasets. However, the enormous cost of labeling medical data makes this challenging. In this paper, we build a cost-sensitive active learning system for the problem of intracranial hemorrhage detection and segmentation on head computed tomography (CT). We show that our ensemble method compares favorably with the state-of-the-art, while running faster and using less memory. Moreover, our experiments are done using a substantially larger dataset than earlier papers on this topic. Since the labeling time could vary tremendously across examples, we model the labeling time and optimize the return on investment. We validate this idea by core-set selection on our large labeled dataset and by growing it with data from the wild.

研究动机与目标

  • 为解决医学图像分割中专家标注的高成本与可变性问题,特别是头颅CT扫描中颅内出血的标注问题。
  • 通过建模不同病例间标注时间的可变性(可相差三个数量级)来改进主动学习。
  • 开发一种成本敏感的主动学习系统,以实现单位标注时间内模型性能的最大化。
  • 在大规模像素级标注数据集(29,095帧)上验证该方法,其规模显著超过以往的MICCAI基准。
  • 展示该系统在从真实世界未标注数据池中高效构建标注数据集方面的实用性,实现高投资回报率。

提出的方法

  • 系统使用在种子集上训练的PatchFCN集成模型,通过查询-委员会方法估计不确定性,利用模型预测之间的Jensen-Shannon散度。
  • 将像素级预测通过连通域分析聚类为区域,计算边界长度和组件数量,作为逻辑回归模型的特征以预测标注时间。
  • 每个堆栈的不确定性定义为前K个高不确定性补丁不确定性的总和,同时对每个堆栈预测标注时间。
  • 给定固定标注预算Q,通过动态规划求解0-1背包问题来选择最优堆栈集合,其中每个堆栈具有权重(时间)和价值(不确定性)。
  • 该方法迭代应用于从大规模未标注池中增长训练集,所选样本经神经放射科医生验证。
  • 在原始种子集和未标注池上均评估性能,以评估领域偏移的鲁棒性。

实验结果

研究问题

  • RQ1成本敏感主动学习能否在颅内出血检测中提升模型性能,同时最小化标注时间?
  • RQ2建模可变的标注时间如何影响所选训练样本的多样性与信息量?
  • RQ3在相同标注预算下,所提方法是否优于均匀成本主动学习和随机选择?
  • RQ4成本敏感主动学习在多大程度上能以最小的人工标注投入高效扩展大规模医学数据集?
  • RQ5当应用于临床来源的真实世界未标注数据时,该系统表现如何?

主要发现

  • 与均匀成本主动学习相比,该成本敏感主动学习系统在未标注池集上的堆栈级平均精度高出10%,在初始阶段提升达20%。
  • 系统在前两轮选择了107个堆栈中的94个,多样性优于均匀成本AL(仅选择11个中的8个),后者多选择标注时间长的大出血病例。
  • 在增强数据集(S_trainval ∪ U_train)上训练的模型在U_test上达到90.1%的平均精度,较仅在S_trainval上训练的基线模型(85.1%)提升5个百分点。
  • 179个所选病例(115例阴性,64例阳性)的实际标注时间与预测时间相差在10%以内,验证了时间预测模型的准确性。
  • 在所有指标上,该方法均优于随机基线选择,且随机基线在早期阶段未表现出对种子集的改进。
  • 该系统比以往最先进方法运行更快、内存占用更低,同时在比标准MICCAI基准大两个数量级的数据集上实现了相当或更优的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。