Skip to main content
QUICK REVIEW

[论文解读] Suggestive Annotation of Brain Tumour Images with Gradient-guided Sampling

Chengliang Dai, Shuo Wang|arXiv (Cornell University)|Jun 26, 2020
Brain Tumor Detection and Classification参考文献 21被引用 5
一句话总结

本文提出了一种基于梯度引导的建议标注框架,通过将损失梯度投影到变分自编码器(VAE)学习到的数据流形上,选择最具信息量的脑肿瘤MRI切片供人工标注。仅使用该方法建议的19%患者体积或7%图像切片,分割模型即可达到与在完整BraTS 2019数据集上训练相当的Dice分数,显著降低了标注成本,同时保持高性能。

ABSTRACT

Machine learning has been widely adopted for medical image analysis in recent years given its promising performance in image segmentation and classification tasks. As a data-driven science, the success of machine learning, in particular supervised learning, largely depends on the availability of manually annotated datasets. For medical imaging applications, such annotated datasets are not easy to acquire. It takes a substantial amount of time and resource to curate an annotated medical image set. In this paper, we propose an efficient annotation framework for brain tumour images that is able to suggest informative sample images for human experts to annotate. Our experiments show that training a segmentation model with only 19% suggestively annotated patient scans from BraTS 2019 dataset can achieve a comparable performance to training a model on the full dataset for whole tumour segmentation task. It demonstrates a promising way to save manual annotation cost and improve data efficiency in medical imaging applications.

研究动机与目标

  • 通过识别最具有信息量的样本供专家审查,减轻医学图像分割中人工标注的高成本和时间负担。
  • 在使用最少专家标注数据的前提下,提升深度学习模型在脑肿瘤分割任务中的数据效率。
  • 探究模型损失的梯度信息是否可用于有效且具有代表性地指导医学图像标注中的样本选择。
  • 比较患者级与图像级建议策略在3D体素MRI数据中优化标注效率的性能。
  • 在从零开始训练和迁移学习场景下,评估该方法相对于随机采样和最优基准的性能表现。

提出的方法

  • 在未标注的脑肿瘤MRI数据上训练变分自编码器(VAE),以学习潜在空间中的低维数据流形。
  • 在主动学习循环中训练一个2D U-Net分割模型,初始阶段使用随机选择的数据进行训练,以生成损失梯度。
  • 将模型训练损失的梯度反向传播回图像空间,得到的梯度整合图像被投影到VAE学习到的潜在空间中。
  • 基于损失梯度的大小和方向,在潜在空间中选择样本,优先选择不确定性高且具有代表性的区域。
  • 该方法支持图像级和患者级采样策略,后者可减少同一体积内切片间的冗余标注。
  • 该框架被迭代应用,但仅评估单轮迭代以检验核心采样策略的有效性。

实验结果

研究问题

  • RQ1将损失梯度投影到VAE学习到的数据流形上,能否有效识别出脑肿瘤分割中最具有信息量的MRI切片用于标注?
  • RQ2在减少标注工作量的前提下,基于梯度引导的采样与随机采样相比,在模型性能上有何差异?
  • RQ3在3D MRI体素数据中,图像级建议是否优于患者级建议以提升标注效率?
  • RQ4在小样本量的建议标注数据上训练的模型,能在多大程度上达到在完整数据集上训练模型的性能?
  • RQ5在迁移学习设置下,即模型在预训练后微调至新数据集时,该方法的性能表现如何?

主要发现

  • 仅使用完整BraTS 2019数据集19%的样本(通过该方法选择)进行训练,分割模型的Dice分数达到0.853,与全量数据集训练性能相当。
  • 在采用图像级建议时,仅需标注39,000张图像中的7%(即2,500张),即可达到标注50个完整患者体积(7,500张切片)的性能水平。
  • 该方法在从零开始训练和迁移学习场景下均优于随机采样,始终获得更高的Dice分数。
  • 该方法性能接近一个后验最优基准(oracle baseline),即在标注后选择最具挑战性的样本,表明所选样本具有高度信息量。
  • 图像级建议比患者级建议更高效,因为它在保持模型性能的同时显著减少了需标注的图像数量。
  • 梯度引导采样方法展现出强大的泛化潜力,在不同数据划分和训练范式下均保持一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。