[论文解读] CONAN: Complementary Pattern Augmentation for Rare Disease Detection
CONAN 通过利用自注意力层次嵌入和互补 GAN,提出了一种用于罕见疾病检测的互补模式增强框架,该 GAN 从不确定(临界)病例中生成合成患者模式。通过疾病检测器作为判别器强制执行最大间隔分类器,该方法在炎症性肠病的 PR-AUC 上实现了 50.1% 的相对提升,在特发性肺纤维化上实现了 41.3% 的相对提升,优于基线方法。
Rare diseases affect hundreds of millions of people worldwide but are hard to detect since they have extremely low prevalence rates (varying from 1/1,000 to 1/200,000 patients) and are massively underdiagnosed. How do we reliably detect rare diseases with such low prevalence rates? How to further leverage patients with possibly uncertain diagnosis to improve detection? In this paper, we propose a Complementary pattern Augmentation (CONAN) framework for rare disease detection. CONAN combines ideas from both adversarial training and max-margin classification. It first learns self-attentive and hierarchical embedding for patient pattern characterization. Then, we develop a complementary generative adversarial networks (GAN) model to generate candidate positive and negative samples from the uncertain patients by encouraging a max-margin between classes. In addition, CONAN has a disease detector that serves as the discriminator during the adversarial training for identifying rare diseases. We evaluated CONAN on two disease detection tasks. For low prevalence inflammatory bowel disease (IBD) detection, CONAN achieved .96 precision recall area under the curve (PR-AUC) and 50.1% relative improvement over best baseline. For rare disease idiopathic pulmonary fibrosis (IPF) detection, CONAN achieves .22 PR-AUC with 41.3% relative improvement over the best baseline.
研究动机与目标
- 为解决罕见疾病检测中患病率极低的问题,即阳性病例稀少且常被误诊。
- 利用诊断不确定的患者——可能为临界病例——作为数据增强的种子,以提升模型泛化能力。
- 克服传统 GAN 和 PU 学习的局限性,生成位于真实正样本和负样本之间的有意义且具有区分性的模式。
- 开发一种通过疾病检测器作为判别器进行对抗训练的框架,以增强最大间隔决策边界,从而提升罕见疾病检测性能。
- 即使仅使用患者 20% 的就诊记录,也能实现在早期阶段检测罕见疾病。
提出的方法
- CONAN 使用自注意力层次神经网络,在就诊级别和患者级别对患者 EHR 数据进行嵌入,以捕捉关键临床模式。
- 构建一种互补 GAN,从不确定的负样本而非随机噪声中生成合成患者嵌入。
- 疾病检测器在对抗训练中充当判别器,区分真实正样本与生成样本,并在聚类之间强制实现最大间隔。
- 生成器被训练以生成接近真实正样本但位于真实正样本与负样本之间的嵌入,从而提升决策边界的鲁棒性。
- 通过生成丰富少数类表示但不扭曲临床真实性的互补样本,实现模式增强。
- 训练为端到端过程,最终的疾病检测器用于对未见患者(包括早期阶段预测)进行推理。
实验结果
研究问题
- RQ1使用临界患者进行模式增强是否能提升在低患病率环境下的罕见疾病检测性能?
- RQ2一种生成位于真实正样本和负样本嵌入之间的样本的互补 GAN,如何影响模型泛化能力和决策边界质量?
- RQ3在对抗训练中整合疾病检测器作为判别器,是否能带来对罕见疾病更好的最大间隔分类效果?
- RQ4在仅使用患者就诊记录的有限部分时,CONAN 能在多大程度上实现罕见疾病的早期检测?
- RQ5CONAN 与标准 GAN、medGAN 和 PU 学习方法相比,在生成具有临床意义的合成模式方面表现如何?
主要发现
- 对于炎症性肠病(IBD),CONAN 实现了 0.96 的 PR-AUC,相比最佳基线方法相对提升了 50.1%。
- 对于特发性肺纤维化(IPF),CONAN 实现了 0.22 的 PR-AUC,相比最佳基线方法相对提升了 41.3%。
- 在早期预测任务中,CONAN 仅使用 20% 的就诊记录仍保持强劲性能,IBD 的 PR-AUC 达到 0.7313,IPF 的 PR-AUC 达到 0.0843。
- t-SNE 可视化结果证实,CONAN 生成的样本位于真实正样本和负样本嵌入之间,从而支持更好的基于间隔的分类。
- 消融实验表明,互补 GAN 和数据增强对性能提升至关重要,而标准 GAN 和 PU 学习方法未能有效降低假阳性率。
- 通过 CONAN 训练的疾病检测器在仅使用有限就诊数据的情况下,也能在早期识别出临界病例,表现出良好鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。