Skip to main content
QUICK REVIEW

[论文解读] Prediction of breast cancer recurrence using Classification Restricted Boltzmann Machine with Dropping

Jakub M. Tomczak|arXiv (Cornell University)|Aug 28, 2013
AI in cancer detection参考文献 9被引用 11
一句话总结

本文提出了一种新颖的基于概率的框架——'Dropping',用于训练分类受限玻尔兹曼机(ClassRBM)以预测乳腺癌复发并识别相关临床特征。该框架引入了DropPart——一种使用Beta分布连接掩码的DropConnect泛化方法,在来自卢布尔雅那肿瘤学研究所的949例真实病例数据集中,其性能优于DropConnect,并与DropOut表现相当。

ABSTRACT

In this paper, we apply Classification Restricted Boltzmann Machine (ClassRBM) to the problem of predicting breast cancer recurrence. According to the Polish National Cancer Registry, in 2010 only, the breast cancer caused almost 25% of all diagnosed cases of cancer in Poland. We propose how to use ClassRBM for predicting breast cancer return and discovering relevant inputs (symptoms) in illness reappearance. Next, we outline a general probabilistic framework for learning Boltzmann machines with masks, which we refer to as Dropping. The fashion of generating masks leads to different learning methods, i.e., DropOut, DropConnect. We propose a new method called DropPart which is a generalization of DropConnect. In DropPart the Beta distribution instead of Bernoulli distribution in DropConnect is used. At the end, we carry out an experiment using real-life dataset consisting of 949 cases, provided by the Institute of Oncology Ljubljana.

研究动机与目标

  • 开发一种名为'Dropping'的新学习框架,用于使用概率连接掩码训练ClassRBM。
  • 将ClassRBM应用于真实临床数据,以预测乳腺癌复发。
  • 通过条件概率分析,发现与疾病复发相关的临床相关输入(症状)。
  • 提出并评估DropPart,一种使用Beta分布掩码的DropConnect泛化方法。
  • 在分类准确率和特征相关性方面,比较DropOut、DropConnect与DropPart的性能。

提出的方法

  • 提出一种通用的概率框架,称为'Dropping',用于学习具有连接掩码的玻尔兹曼机。
  • 引入DropPart,其中连接掩码从Beta分布(参数a, b ≤ 1)中抽取,对基于伯努利分布的DropConnect进行泛化。
  • 使用ClassRBM对可见输入(临床特征)、隐单元和输出类别(复发或无复发)的联合分布进行建模。
  • 采用条件分布p(y|x)进行预测,该分布基于能量模型,并通过输出类别上的softmax进行归一化。
  • 使用p(xi=1|x\i=0,y)计算输入相关性,识别在其他输入缺失时最能预测复发的特征。
  • 采用小批量更新的随机梯度下降法,并在训练中使用掩码之和进行近似推理。

实验结果

研究问题

  • RQ1所提出的'Dropping'框架是否能提升ClassRBM在乳腺癌复发预测中的泛化能力和预测性能?
  • RQ2与使用伯努利掩码的DropConnect相比,使用Beta分布掩码的DropPart在分类准确率方面表现如何?
  • RQ3通过模型的条件输入概率,哪些临床特征被识别为预测乳腺癌复发的关键因素?
  • RQ4与SVM、随机森林和人类肿瘤学家相比,使用Dropping方法的ClassRBM在预测准确率上是否表现更优?
  • RQ5该模型能否有效识别出如肿瘤类型或激素受体水平等具有生物学意义的特征作为复发的关键预测因子?

主要发现

  • DropOut在所有测试方法中取得了最高的分类准确率(0.750),优于DropConnect和DropPart。
  • 使用Beta(0.1, 0.1)的DropPart在性能上与DropConnect相当,但在某些配置下(尤其是学习率较低时)表现略优。
  • 使用DropPart的ClassRBM成功识别出临床相关特征:组织学肿瘤类型(导管型、小叶型、其他)以及低孕酮受体水平(<10 fmol/mg)对复发预测具有高度相关性。
  • 肿瘤大小>50 mm(输入编号5)被发现不具备预测能力,这可能与传统认知相悖,需进一步临床验证。
  • 该模型的预测性能(AUC为0.735–0.750)优于或与传统模型(SVM为0.710,朴素贝叶斯为0.730,随机森林为0.650)相当,甚至在100例子集上超越了两位人类肿瘤学家(准确率均为0.630)。
  • 该方法通过基于条件相关性的定量排序,展现出强大的可解释能力,为复发预测因子提供了可解释的洞察。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。