Skip to main content
QUICK REVIEW

[论文解读] IAM at CLEF eHealth 2018: Concept Annotation and Coding in French Death Certificates

Sébastien Cossin, Vianney Jouhet|arXiv (Cornell University)|Jul 10, 2018
Biomedical Text Mining and Ontologies被引用 5
一句话总结

本论文提出了一种基于词典的法语死亡证明 ICD-10 编码方法,采用归一化术语匹配、Levenshtein 距离进行拼写错误纠正,以及缩写处理。该系统在 CLEF eHealth 2018 挑战赛中取得了 0.786 的 F1 分数(精确率:0.794,召回率:0.779),优于平均水平参赛者。

ABSTRACT

In this paper, we describe the approach and results for our participation in the task 1 (multilingual information extraction) of the CLEF eHealth 2018 challenge. We addressed the task of automatically assigning ICD-10 codes to French death certificates. We used a dictionary-based approach using materials provided by the task organizers. The terms of the ICD-10 terminology were normalized, tokenized and stored in a tree data structure. The Levenshtein distance was used to detect typos. Frequent abbreviations were detected by manually creating a small set of them. Our system achieved an F-score of 0.786 (precision: 0.794, recall: 0.779). These scores were substantially higher than the average score of the systems that participated in the challenge.

研究动机与目标

  • 使用基于规则的系统自动为法语死亡证明分配 ICD-10 编码。
  • 在医师录入文本中存在拼写变体和缩写的情况下,提升医学术语的识别能力。
  • 评估通用语义标注工具在共享生物医学 NLP 挑战赛中的性能表现。
  • 研究在系统中引入外部 ICD-10 术语对召回率和精确率的影响。
  • 识别术语检测中的局限性,特别是针对孤立形容词或复合术语。

提出的方法

  • 构建了两个词典:一个基于训练集中人工编码的术语(运行 2),另一个通过在前者基础上增加 2015 年 ICD-10 术语库(运行 1)。
  • 通过移除变音符号、标点符号、转为小写以及去除停用词,对术语进行归一化处理。
  • 对术语进行分词,并将其存储在树形数据结构中,其中从根到叶的每条路径代表一个 N-gram 术语。
  • 对每个分词使用三种匹配技术:完全匹配、缩写匹配(基于手动整理的列表),以及 Levenshtein 距离进行拼写错误检测。
  • 利用 Lucene™ 实现高效字符串匹配,包括单字词和双字词索引,以解决复合术语问题。
  • 在每一步中选择最长的已识别术语,并在无法找到有效延续时从树的根节点重新开始搜索。

实验结果

研究问题

  • RQ1基于词典的系统结合拼写错误纠正与缩写处理,能否有效将医师书写的死亡证明文本映射到 ICD-10 编码?
  • RQ2引入外部 ICD-10 术语库对编码的召回率和精确率有何影响?
  • RQ3孤立形容词对术语识别有何影响?是否可被缓解?
  • RQ4通用标注工具在共享基准测试中的表现与专用系统相比如何?
  • RQ5Levenshtein 距离与 N-gram 索引在提升词汇变体识别能力方面能发挥多大作用?

主要发现

  • 在仅使用训练集中人工编码术语的运行 2 中,系统取得了 0.786 的 F1 分数(精确率:0.794,召回率:0.779)。
  • 运行 1(包含 2015 年 ICD-10 术语库)的召回率(0.772)和 F1 分数(0.777)略低,表明额外术语并未提升性能。
  • 该系统优于平均水平参赛者(F1 分数:0.634)和中位数参赛者(F1 分数:0.641)。
  • 主要局限在于当形容词孤立存在时无法检测到术语,例如在 'metastase hepatique et renale' 中的 'renale'。
  • 手动添加常见缩写可提升召回率,但若能自动化该过程,性能有望进一步提升。
  • 后续步骤可考虑后处理过滤和引入机器学习技术,以提高精确率并处理无关编码。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。