[论文解读] Evaluating robustness of language models for chief complaint extraction from patient-generated text
本研究评估了微调后的 BERT 模型与 TF-IDF 基线在从患者生成的文本中提取结构化主诉方面的鲁棒性,使用了一个包含约 20 万个患者就诊原因的新数据集。令人惊讶的是,TF-IDF 基线在测试集上的表现优于甚至超过最佳微调 BERT 模型(CC BERT)(PR-AUC 0.3878 vs. 0.3597,p=7×10⁻⁵),尽管在定性分析中 BERT 模型在拼写错误和复杂查询方面表现出更强的鲁棒性。
Automated classification of chief complaints from patient-generated text is a critical first step in developing scalable platforms to triage patients without human intervention. In this work, we evaluate several approaches to chief complaint classification using a novel Chief Complaint (CC) Dataset that contains ~200,000 patient-generated reasons-for-visit entries mapped to a set of 795 discrete chief complaints. We examine the use of several fine-tuned bidirectional transformer (BERT) models trained on both unrelated texts as well as on the CC dataset. We contrast this performance with a TF-IDF baseline. Our evaluation has three components: (1) a random test hold-out from the original dataset; (2) a "misspelling set," consisting of a hand-selected subset of the test set, where every entry has at least one misspelling; (3) a separate experimenter-generated free-text set. We find that the TF-IDF model performs significantly better than the strongest BERT-based model on the test (best BERT PR-AUC $0.3597 \pm 0.0041$ vs TF-IDF PR-AUC $0.3878 \pm 0.0148$, $p=7\cdot 10^{-5}$), and is statistically comparable to the misspelling sets (best BERT PR-AUC $0.2579 \pm 0.0079$ vs TF-IDF PR-AUC $0.2733 \pm 0.0130$, $p=0.06$). However, when examining model predictions on experimenter-generated queries, some concerns arise about TF-IDF baseline's robustness. Our results suggest that in certain tasks, simple language embedding baselines may be very performant; however, truly understanding their robustness requires further analysis.
研究动机与目标
- 构建一个用于临床 NLP 任务的新颖、大规模患者生成的就诊原因与结构化主诉映射数据集。
- 评估预训练语言模型(BERT 变体)和 TF-IDF 基线在从自由文本患者输入中提取结构化主诉方面的性能与鲁棒性。
- 评估模型在分布偏移情况下的表现,包括拼写错误和非标准患者语言。
- 探究将人口统计学特征(年龄、性别)与文本嵌入结合以提升分类性能的影响。
提出的方法
- 构建了一个前馈神经网络,将预训练的文本嵌入(BERT、BioBERT、Clinical BERT、KP BERT、CC BERT)与患者年龄(离散化)和生物学性别的学习嵌入相结合。
- 使用 5 折交叉验证在 190,243 个训练就诊记录和 31,815 个测试就诊记录的数据集上训练模型,共包含 795 种独特的主诉。
- 在三个测试集上评估模型:标准保留测试集、人工校对的拼写错误测试集(245 个条目,至少包含一个拼写错误),以及研究者生成的自由文本查询集。
- 使用微平均 PR-AUC 和 ROC-AUC 作为主要指标,并采用 Welch’s t 检验进行统计显著性分析。
- 对 TF-IDF 基线应用停用词去除和 n-gram 分词,该基线在患者文本语料库上进行训练。
- 对模型在分布外查询上的预测结果进行定性分析,以评估其对上下文、人口统计学信息和拼写变异的敏感性。
实验结果
研究问题
- RQ1TF-IDF 基线是否在从患者生成的文本中提取结构化主诉方面优于微调 BERT 模型?
- RQ2BERT 模型与 TF-IDF 在分布偏移(如拼写错误或非标准语言)下的表现如何?
- RQ3人口统计学特征(年龄与性别)在多大程度上能提升文本嵌入模型在主诉分类中的性能?
- RQ4BERT 模型是否比 TF-IDF 对训练数据中未见的复杂或口语化患者语言更具鲁棒性?
- RQ5在低资源临床 NLP 场景中,模型架构与预训练对鲁棒性的影响有何相对重要性?
主要发现
- TF-IDF 基线在标准测试集上实现了 0.3878±0.0148 的微平均 PR-AUC,显著优于最佳 BERT 模型(CC BERT)的 0.3597±0.0041(p=7×10⁻⁵)。
- 在拼写错误测试集中,TF-IDF 基线的 PR-AUC 为 0.2733±0.0130,而 CC BERT 为 0.2579±0.0079,差异无统计学意义(p=0.06)。
- 尽管在标准基准上表现更优,TF-IDF 模型在面对分布外查询(如口语化或高度拼写错误的条目)时,其鲁棒性低于 BERT 模型。
- BERT 模型,特别是 KP BERT 和 CC BERT,对上下文线索和人口统计学信息表现出更强的敏感性,能够根据患者年龄正确预测不同的主诉。
- 在分布偏移下,TF-IDF 与 BERT 模型之间的性能差距缩小,表明 TF-IDF 可能对现实患者输入中的语言变体更敏感。
- 定性分析显示,BERT 模型能够正确分类罕见或非正式表达(例如,'my tum-tum is upset' → 'abdominal pain'),表明其对非标准语言具有更好的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。