Skip to main content
QUICK REVIEW

[论文解读] Students Need More Attention: BERT-based AttentionModel for Small Data with Application to AutomaticPatient Message Triage

Shijing Si, Rui Wang|arXiv (Cornell University)|Jun 22, 2020
Topic Modeling参考文献 48被引用 6
一句话总结

本文提出 LESA-BERT,一种基于 BERT 的模型,采用标签感知的自注意力机制,适用于小规模、类别不平衡的医疗数据集,并将其应用于患者消息自动分诊。通过将标签嵌入融入注意力机制并采用知识蒸馏将模型压缩为更小的变体,该方法减少了过拟合并提升了性能,在包含 1,756 条消息的紧急程度数据集上,宏 F1 分数比强基线高出 4.3%。

ABSTRACT

Small and imbalanced datasets commonly seen in healthcare represent a challenge when training classifiers based on deep learning models. So motivated, we propose a novel framework based on BioBERT (Bidirectional Encoder Representations from Transformers forBiomedical TextMining). Specifically, (i) we introduce Label Embeddings for Self-Attention in each layer of BERT, which we call LESA-BERT, and (ii) by distilling LESA-BERT to smaller variants, we aim to reduce overfitting and model size when working on small datasets. As an application, our framework is utilized to build a model for patient portal message triage that classifies the urgency of a message into three categories: non-urgent, medium and urgent. Experiments demonstrate that our approach can outperform several strong baseline classifiers by a significant margin of 4.3% in terms of macro F1 score. The code for this project is publicly available at \url{https://github.com/shijing001/text_classifiers}.

研究动机与目标

  • 解决在医疗领域常见的小规模、类别不平衡临床数据集上训练深度学习模型的挑战。
  • 在有限数据上微调类似 BioBERT 的大型预训练模型时,提升模型性能并减少过拟合。
  • 开发一种实用且可部署的系统,用于将患者门户网站消息分类为紧急程度等级:非紧急、中等、紧急。
  • 通过知识蒸馏实现出色的推理效率,同时不损失性能。
  • 提供一种可泛化的框架,适用于其他在标注数据有限的临床 NLP 任务。

提出的方法

  • 在每个 BERT 层中引入标签嵌入的自注意力机制(LESA),使模型在序列编码过程中能够关注与标签相关的表示。
  • 使用预训练的 BioBERT 初始化,对 12 层的 LESA-BERT 模型在患者消息数据集上进行微调。
  • 通过知识蒸馏将 12 层的 LESA-BERT 压缩为更小的 6 层和 3 层变体,以减少过拟合和模型大小。
  • 使用蒸馏模型中 [CLS] token 的表示进行下游的紧急程度分类。
  • 采用类别平衡采样策略,使用交叉熵损失端到端训练蒸馏模型,以应对数据不平衡问题。
  • 通过宏 F1 分数和 t-SNE 可视化分析潜在空间中类别的可分性来评估性能。

实验结果

研究问题

  • RQ1在 BERT 的自注意力机制中引入标签嵌入,是否能提升小规模、类别不平衡的临床文本分类任务的性能?
  • RQ2从大型、微调后的 LESA-BERT 模型蒸馏到更小的变体,是否能减少过拟合并在有限数据上提升泛化能力?
  • RQ3所提出的 LESA-BERT 框架在患者消息分诊任务中,与 SVM、随机森林和标准 BERT 等强基线相比,性能如何?
  • RQ4LESA-BERT 学习到的表示在多大程度上能将不同紧急程度的类别区分开?标签主观性在其中起到什么影响?
  • RQ5该框架能否有效应用于真实世界中标注数据有限的医疗 NLP 任务?

主要发现

  • LESA-BERT 框架取得了 0.746 的宏 F1 分数,相比所有强基线分类器显著高出 4.3 个百分点。
  • 6 层的 Distil-LESA-BERT 模型表现优于完整的 12 层 LESA-BERT 模型,表明知识蒸馏能有效减少小样本数据上的过拟合并提升泛化能力。
  • t-SNE 可视化显示,非紧急消息与中等及紧急消息之间有良好分离,而中等和紧急消息由于特征相似性和标注主观性,表现出显著重叠。
  • 模型在否定句处理上表现不佳,例如将 'No chest pain' 这类消息错误分类为紧急,原因在于强关键词的影响,凸显了对否定感知建模的必要性。
  • 该框架具有良好的泛化能力,可应用于其他临床 NLP 任务中数据量有限的场景,为医疗 AI 中的数据稀缺问题提供实用解决方案。
  • 该系统具备临床实用性,可实现自动化分诊,有望释放临床医生时间,并加快对紧急消息的响应速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。