Skip to main content
QUICK REVIEW

[论文解读] Phenotyping of Clinical Notes with Improved Document Classification Models Using Contextualized Neural Language Models

Andriy Mulyar, Elliot Schumacher|arXiv (Cornell University)|Oct 30, 2019
Topic Modeling参考文献 18被引用 21
一句话总结

本文提出了一种基于 BERT 的临床笔记表型分类框架,通过在分段笔记块上对上下文嵌入进行平均池化,生成文档级表征。该方法在 I2B2 2006 年吸烟状态表型分类任务中达到最先进性能,相比先前基于规则的系统在 micro-F1 上提升了 2.8%,表明在使用上下文嵌入语言模型时,简单的池化策略已足够,无需复杂架构。

ABSTRACT

Clinical notes contain an extensive record of a patient's health status, such as smoking status or the presence of heart conditions. However, this detail is not replicated within the structured data of electronic health systems. Phenotyping, the extraction of patient conditions from free clinical text, is a critical task which supports avariety of downstream applications such as decision support and secondary use of medical records. Previous work has resulted in systems which are high performing but require hand engineering, often of rules. Recent work in pretrained contextualized language models have enabled advances in representing text for a variety of tasks. We therefore explore several architectures for modeling pheno-typing that rely solely on BERT representations of the clinical note, removing the need for manual engineering. We find these architectures are competitive with or outperform existing state of the art methods on two phenotyping tasks.

研究动机与目标

  • 开发一种可泛化、端到端的临床笔记表型分类框架,利用上下文神经语言模型进行表型识别。
  • 通过利用预训练的 BERT 表征,消除对人工特征工程(如否定检测或时间短语识别)的依赖。
  • 评估简单聚合方法(如平均池化)是否能在长文档表型分类任务中超越复杂架构。
  • 在两个既定的表型分类基准(吸烟状态与肥胖相关共病)上评估 BERT 基模型的性能。
  • 提供公开的 PyTorch 实现,以促进可复现性及在临床 NLP 领域的广泛应用。

提出的方法

  • 使用 WordPiece 分词法将临床笔记分词并分割为长度为 512 的非重叠段(BERT 的最大输入长度)。
  • 使用经过临床微调的 BERT 模型对每个段落进行编码,生成每个子词标记的上下文隐藏状态。
  • 采用四种聚合策略构建文档级表征:平均池化、最大池化、基于 LSTM 的编码以及多头自注意力(Transformer 式池化)。
  • 将池化后的表征通过一个带有 Sigmoid 激活函数的前馈分类器,用于表型特征的二分类或多标签分类。
  • 在 I2B2 2006(吸烟)和 I2B2 2008(肥胖)共享任务数据集上端到端训练模型,共训练 1000 个周期,由于缺乏验证集,未进行超参数调优。
  • 该方法避免了基于规则的预处理,转而完全依赖上下文嵌入,使其能够无需针对特定任务进行工程设计,即可适应多种表型特征。

实验结果

研究问题

  • RQ1基于 BERT 的文档分类模型是否能在无需手工特征或基于规则组件的情况下,在临床表型分类任务中实现最先进性能?
  • RQ2在文档段落上对 BERT 表征进行平均池化是否优于更复杂的聚合架构(如 LSTM 或多头注意力)?
  • RQ3BERT 基模型与先前基于规则和 CNN 的系统在既定表型分类基准上的表现如何比较?
  • RQ4当仅依赖前 510 个标记(如标准 BERT 应用)时,模型性能下降程度如何?
  • RQ5即使结合简单、非学习型的池化策略,BERT 的上下文表征是否足以捕捉表型信号?

主要发现

  • 平均池化策略($f_{\text{mean}}$)在 I2B2 2006 年吸烟状态表型分类任务中取得了 92.8 的 micro-F1,相比先前共享任务冠军(90.0)高出 2.8 个百分点。
  • $f_{\text{mean}}$ 架构在 I2B2 2008 年肥胖共病任务中也取得了最高 F1(86.5),仅在多数类别基线中优于共享任务第一名系统(95.0)。
  • 基于 Transformer 的池化方法($f_{\text{Transformer}}$)表现最差,吸烟任务 F1 仅为 58.4,肥胖任务为 70.4,表明在低数据设置下,模型容量增加未必带来性能提升。
  • 基于 LSTM 的池化方法($f_{I}$)在吸烟任务中取得 92.3 的 F1,在肥胖任务中为 83.1,表现具有竞争力,但未超越平均池化。
  • 基线 DocBert 模型(仅使用前 510 个标记)在吸烟任务中仅取得 80.2 的 F1,在肥胖任务中为 67.6,证实其无法捕捉长临床笔记中的关键信息。
  • 本研究证明,对 BERT 表征进行简单的平均池化已足以在临床文档分类中实现高性能,无需依赖复杂且任务特定的架构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。