[论文解读] Assigning Medical Codes at the Encounter Level by Paying Attention to Documents
本文提出了一种分层注意力模型——会诊级文档注意力网络(ELDAN),通过识别多文档临床会诊中的相关文档,提升了会诊级别的医疗编码准确性。该模型在无需文档级别标注的情况下实现了最先进性能,显著优于基线模型,并通过突出显示源文档实现了可解释的编码审查。
The vast majority of research in computer assisted medical coding focuses on coding at the document level, but a substantial proportion of medical coding in the real world involves coding at the level of clinical encounters, each of which is typically represented by a potentially large set of documents. We introduce encounter-level document attention networks, which use hierarchical attention to explicitly take the hierarchical structure of encounter documentation into account. Experimental evaluation demonstrates improvements in coding accuracy as well as facilitation of human reviewers in their ability to identify which documents within an encounter play a role in determining the encounter level codes.
研究动机与目标
- 为解决计算机辅助医疗编码(CAC)中会诊级别编码而非文档级别编码的空白。
- 通过建模由多个文档组成的临床会诊的分层结构,提升编码准确性。
- 通过使人类编码员能够识别支持每个会诊级别编码的文档,增强可解释性。
- 开发一种无需昂贵文档级别标注的方法,仅在训练过程中使用会诊级别编码。
- 评估模型分配注意力权重的能力,使其与人类对源文档的判断一致。
提出的方法
- ELDAN 使用一种分层注意力机制,处理三个层次的文本:句子中的词、文档中的句子,以及临床会诊中的文档。
- 通过UMLS CUI和内部概念标识符将原始临床文本转换为特征向量,保护患者隐私。
- 该模型应用多级注意力,学习哪些文档最有助于预测会诊级别编码。
- 采用一对多分类设置,并为所有编码共享编码器,从而实现高效训练和稀有编码的迁移学习。
- 使用文档级别注意力得分来预测源文档,并与人工标注进行评估。
- 模型在会诊级别编码上端到端训练,避免了对文档级别编码标注的需求。
实验结果
研究问题
- RQ1能否利用临床会诊分层结构的深度学习模型提升会诊级别的编码准确性?
- RQ2该模型的文档级别注意力机制是否与人类对会诊编码源文档的判断一致?
- RQ3该模型能否在无需文档级别标注的情况下实现高性能?
- RQ4在该设置下,对稀有医疗编码的朴素迁移学习方法有多有效?
- RQ5注意力机制能否作为一种弱监督形式,用于指导人工审查或主动学习?
主要发现
- ELDAN 在会诊级别编码准确性上显著优于强基线模型,且差异具有统计学意义(p < .05)。
- 对于前20个最频繁的CPT编码,ELDAN 在19个编码中的7个实现了100%的F1分数,表明其在高频编码上表现强劲。
- 平均而言,ELDAN 的文档注意力F1分数比随机基线高出15.5分,其中编码12002的提升达36.29分。
- 尽管仅涉及6次会诊和18份文档,ELDAN 在编码43235上仍比随机基线高出42.38分的F1分数。
- 注意力机制与人类编码员对源文档的判断高度一致,编码43239的F1分数差异达29.67分。
- 该模型展示了有效的迁移学习能力,朴素方法在无需微调的情况下显著提升了稀有编码的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。