[论文解读] Keyword-optimized Template Insertion for Clinical Information Extraction via Prompt-based Learning
本文提出关键词优化模板插入(KOTI)方法,通过在临床相关关键词周围战略性地放置提示模板,提升零样本和少样本临床笔记分类的性能。KOTI 在训练数据有限或不平衡时,相较于标准模板插入方法显著提升模型表现,同时通过基于关键词位置的单次推理截断保持计算效率。
Clinical note classification is a common clinical NLP task. However, annotated data-sets are scarse. Prompt-based learning has recently emerged as an effective method to adapt pre-trained models for text classification using only few training examples. A critical component of prompt design is the definition of the template (i.e. prompt text). The effect of template position, however, has been insufficiently investigated. This seems particularly important in the clinical setting, where task-relevant information is usually sparse in clinical notes. In this study we develop a keyword-optimized template insertion method (KOTI) and show how optimizing position can improve performance on several clinical tasks in a zero-shot and few-shot training setting.
研究动机与目标
- 为解决临床笔记分类中标注数据有限的挑战,利用基于提示的学习方法。
- 探究在基于提示学习的临床 NLP 中,模板位置的影响,特别是在零样本和少样本设置下。
- 开发一种计算高效的模型,确保在输入截断过程中保留临床相关的信息。
- 通过平衡的少样本训练,提升模型在罕见或类别不平衡类别上的泛化能力。
- 评估关键词感知的模板插入是否能优于简单的截断方法和固定位置的提示方法。
提出的方法
- KOTI 识别临床笔记中的临床相关关键词,并在这些关键词周围插入提示模板,以最大化信息保留。
- 该方法采用基于关键词的截断策略,优先保留包含关键词的文本片段,确保关键临床信息得以保留。
- 提示模板通过任务特定目标和 [MASK] 标记手动设计,且通过词元映射将模型输出映射到类别标签。
- 在临床 BERT 和 BioBERT 模型上,评估模板插入在零样本和少样本设置下的表现。
- 与标准模板插入(STI-k, STI-s)以及少样本学习中的平衡采样与随机采样进行性能对比。
- 该方法通过使用单个、关键词优化的输入片段避免多次推理运行,与基于分块的方法(如 HealthPrompt)不同。
实验结果
研究问题
- RQ1在临床相关关键词周围优化提示模板的位置,是否能提升零样本和少样本临床笔记分类的性能?
- RQ2基于关键词的截断与标准尾部截断相比,在输入长度受限条件下,是否更能保持模型性能?
- RQ3当训练数据有限或类别不平衡时,KOTI 是否能提升性能?
- RQ4KOTI 的性能增益是否在不同临床分类任务中保持一致?
- RQ5模板位置在临床 NLP 中是否具有任务依赖性,KOTI 是否能利用这一特性?
主要发现
- 在零样本和少样本设置下,KOTI 显著优于 STI-k 和 STI-s 的 F1 和宏 F1 分数,尤其在数据量较少的场景下增益最大。
- 平均而言,KOTI 在零样本学习中比 STI-k 提高 0.076 的 F1 分数,并在少样本场景中表现出一致的性能提升,尤其在训练数据不平衡时效果更明显。
- 基于关键词的截断比标准尾部截断保留了更多相关信息,从而带来更好的性能表现,尤其在 ClinicalBERT 上表现显著,后者在简单截断下出现性能停滞。
- 在平衡样本上训练可提升模型性能,相较于随机采样,而 KOTI 进一步增强了这一效果,使模型在更少样本下实现更快收敛和更优性能。
- KOTI 的性能增益具有任务依赖性,其中在经血夹痛(dysmenorrhea)任务中提升最大,因为该任务中关键词被更准确地预先选定。
- KOTI 通过每条笔记仅需一次推理,保持了计算效率,而基于分块的方法需要多次推理运行,因此 KOTI 在处理长临床笔记时更具可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。