[论文解读] Label-Assemble: Leveraging Multiple Datasets with Partial Labels
Label-Assemble 提出了一种新颖的框架,通过将负面标签和相关疾病标签作为辅助信号,利用类别查询、伪标签和一致性正则化,从异构的公开数据集中整合病理学上和空间上相关的标签,从而在无需完整标注的情况下,显著提升医学影像模型性能。该方法在 COVID-19 诊断准确率上达到 99.3%,PDAC 检测灵敏度提升至 84.0%,实现了当前最先进水平,充分证明了利用部分标注数据的潜力。
The success of deep learning relies heavily on large labeled datasets, but we often only have access to several small datasets associated with partial labels. To address this problem, we propose a new initiative, "Label-Assemble", that aims to unleash the full potential of partial labels from an assembly of public datasets. We discovered that learning from negative examples facilitates both computer-aided disease diagnosis and detection. This discovery will be particularly crucial in novel disease diagnosis, where positive examples are hard to collect, yet negative examples are relatively easier to assemble. For example, assembling existing labels from NIH ChestX-ray14 (available since 2017) significantly improves the accuracy of COVID-19 diagnosis from 96.3% to 99.3%. In addition to diagnosis, assembling labels can also improve disease detection, e.g., the detection of pancreatic ductal adenocarcinoma (PDAC) can greatly benefit from leveraging the labels of Cysts and PanNets (two other types of pancreatic abnormalities), increasing sensitivity from 52.1% to 84.0% while maintaining a high specificity of 98.0%.
研究动机与目标
- 通过利用部分标注的公开医学影像数据集,解决医学影像中标签数据有限的挑战。
- 克服现有方法仅使用已标注数据部分的局限,挖掘未标注或部分标注样本的潜在价值。
- 探究从负样本或相关疾病样本中学习是否能提升罕见或新发疾病模型的性能。
- 开发一种统一框架,能够动态整合来自多个数据集的异构且可能冲突的标签。
- 证明通过整合在病理学或空间上相关的疾病标签,可在诊断与检测任务中实现显著性能提升。
提出的方法
- 引入可学习的类别查询机制,编码视觉任务,实现对不同类别数量的数据集之间部分标签的动态整合。
- 使用共享的卷积神经网络(CNN)提取图像特征,随后通过预测头计算预测结果,方法为特征与类别查询之间的内积运算。
- 在标签可用时应用二元交叉熵损失(ℒ_bce);在标签缺失时,采用伪标签和一致性正则化策略,引入无监督损失(ℒ_pseudo 和 ℒ_consist)。
- 利用伪标签为未标注样本生成预测,并通过增强数据间的一致性,缓解不同数据集之间的领域偏移问题。
- 通过端到端联合训练,结合监督与自监督目标,充分利用来自异构来源的已标注与未标注数据。
- 通过类别查询机制,使框架可扩展至多任务学习,支持任意可变数量的类别,突破传统固定类别分类的限制。
实验结果
研究问题
- RQ1从部分标注数据集中学习负样本,是否能提升目标疾病(如 COVID-19)模型的性能?
- RQ2通过整合与目标疾病在病理学上相似的疾病标签(如以肺炎作为 COVID-19 的辅助标签),是否能提升诊断性能,优于仅依赖正样本?
- RQ3通过利用与目标异常在解剖学上相关的标签(如以囊肿和 PanNET 作为 PDAC 的辅助标签),是否能提升疾病检测的灵敏度?
- RQ4仅使用来自多个异构数据集的部分标签,是否可实现与完整标签学习相当的性能?
- RQ5所提出的 Label-Assemble 框架与仅利用已标注数据或需要完整标注的现有方法相比,表现如何?
主要发现
- 通过整合 NIH ChestX-ray14 中的标签,Label-Assemble 将 COVID-19 诊断准确率从 96.3% 提升至 99.3%,证明从负样本和相关疾病样本中学习有助于优化决策边界。
- 通过引入与胰腺导管腺癌(PDAC)相关的胰腺异常标签(如囊肿和 PanNET),PDAC 检测灵敏度从 52.1% 提升至 84.0%,同时保持高特异性(98.0%)。
- 性能提升与类别间相似度呈正相关:在肺结节分类任务中,性能提升与所整合疾病相似度的皮尔逊相关系数为 r=0.83(p=4.93e-4)。
- Label-Assemble 在 NIH ChestX-ray14 上实现了 0.832 的 mAUC,达到当前最先进水平,在 14 种胸部疾病中的 13 种上优于先前方法,并使 CheXpert 性能相比基线提升 1.8%。
- 该框架在性能上与完整标签学习相当,同时将标注成本降低 40%(75,310 个部分标签 vs. 105,434 个完整标签),表明完整标签补全并非必要。
- 由于具备自适应类别查询与一致性正则化机制,该方法在多任务与半监督设置下,显著优于现有部分标签基线方法(如 DoDNet 和 Med3D)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。