Skip to main content
QUICK REVIEW

[论文解读] Medical symptom recognition from patient text: An active learning approach for long-tailed multilabel distributions

Ali Mottaghi, Prathusha K Sarma|arXiv (Cornell University)|Nov 12, 2020
Topic Modeling参考文献 28被引用 6
一句话总结

本文提出了一种用于从患者文本中进行医学症状识别的主动学习方法,利用潜在空间聚类方法应对长尾、多标签分布问题。通过平衡选择靠近聚类中心的样本与远离已标注数据的样本,该方法在标注数据有限且标签频率偏斜的情况下,仍实现了优异的多标签分类性能。

ABSTRACT

We study the problem of medical symptoms recognition from patient text, for the purposes of gathering pertinent information from the patient (known as history-taking). A typical patient text is often descriptive of the symptoms the patient is experiencing and a single instance of such a text can be "labeled" with multiple symptoms. This makes learning a medical symptoms recognizer challenging on account of i) the lack of availability of voluminous annotated data as well as ii) the large unknown universe of multiple symptoms that a single text can map to. Furthermore, patient text is often characterized by a long tail in the data (i.e., some labels/symptoms occur more frequently than others for e.g "fever" vs "hematochezia"). In this paper, we introduce an active learning method that leverages underlying structure of a continually refined, learned latent space to select the most informative examples to label. This enables the selection of the most informative examples that progressively increases the coverage on the universe of symptoms via the learned model, despite the long tail in data distribution.

研究动机与目标

  • 解决在患者自述文本中识别多种频繁共现症状的挑战,这些症状通常表现出长尾标签分布。
  • 通过实现高效、主动的标注过程,减少对大规模标注数据集的依赖,从而最小化人工工作量。
  • 通过从潜在空间中战略性地选择多样化、信息丰富的样本,提升对罕见和新兴症状的模型覆盖能力。
  • 开发一种方法,平衡对新潜在聚类的探索与对已有聚类的利用,克服以往医疗主动学习方法的局限性。
  • 通过高效扩展症状识别能力,实现自动化病史采集系统在远程医疗中的可扩展、实际部署。

提出的方法

  • 该方法使用深度神经网络将患者文本嵌入到潜在空间中,捕捉具有医学意义的语义结构。
  • 在潜在空间中应用亲和传播算法对未标注样本进行聚类,识别出对应于症状模式的密集区域。
  • 采用混合选择标准,平衡两个目标:选择靠近聚类中心的样本(利用)和选择远离已标注样本的样本(探索)。
  • 选择标准被表述为到已标注样本距离与到聚类中心距离的加权组合,其中可学习的超参数 λ 控制两者之间的权衡。
  • 模型根据此标准迭代选择最具信息量的样本,每次标注后重新训练,以优化潜在空间和聚类结构。
  • 该方法通过动态适应新数据和新聚类发现,逐步覆盖潜在症状的全集,包括罕见症状。

实验结果

研究问题

  • RQ1如何有效将主动学习适配于从患者文本中进行医学症状识别的多标签、长尾分布问题?
  • RQ2潜在空间聚类能否在低资源、高变异性的临床文本环境中提升所选训练样本的多样性和覆盖范围?
  • RQ3在探索潜在空间中新区域与利用已知密集聚类之间,最优平衡点是什么?
  • RQ4与现有主动学习基线相比,所提方法在多标签 F1 分数和罕见症状召回率方面是否表现更优?
  • RQ5该方法在具有动态演变症状词汇和非标准患者语言的现实远程医疗数据中,其泛化能力如何?

主要发现

  • 所提出的主动学习方法在多标签分类性能上优于最先进的基线模型,尤其在 F1 分数和罕见症状召回率方面表现更优。
  • 消融实验表明,最优超参数 λ ≈ 0.1 实现了探索新聚类与利用现有聚类之间的最佳平衡,优于纯探索或纯利用策略。
  • 通过 t-SNE 可视化进行的定性分析证实,该方法在潜在空间中选择了多样化且分布均匀的样本,覆盖了密集聚类区域和此前未探索的区域。
  • 该方法能随时间推移持续提升模型覆盖范围,成功发现并标注了此前未见的症状,这对具有动态演变患者术语的现实远程医疗应用至关重要。
  • 即使在标注数据有限的情况下,模型仍保持强劲性能,展现出对数据稀缺和长尾标签分布的鲁棒性。
  • 该方法通过优先选择能最大化整个症状空间信息增益的样本,实现了高效的数据标注,降低了标注成本,同时提升了模型泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。