Skip to main content
QUICK REVIEW

[论文解读] Annotating Electronic Medical Records for Question Answering

Preethi Raghavan, Siddharth Patwardhan|arXiv (Cornell University)|May 17, 2018
Topic Modeling参考文献 18被引用 13
一句话总结

本文提出了一种可复现的、由医学生主导的方法,从电子健康记录(EHRs)中构建高质量、患者特定的问答数据集。该方法实现了0.71的Cohen's kappa评分,即标注者间一致性,共生成了71名患者记录的5,696个问题,其中1,747个问题配有专家标注的答案,从而为医疗领域基于机器学习的问答系统训练与评估提供了支持。

ABSTRACT

Our research is in the relatively unexplored area of question answering technologies for patient-specific questions over their electronic health records. A large dataset of human expert curated question and answer pairs is an important pre-requisite for developing, training and evaluating any question answering system that is powered by machine learning. In this paper, we describe a process for creating such a dataset of questions and answers. Our methodology is replicable, can be conducted by medical students as annotators, and results in high inter-annotator agreement (0.71 Cohen's kappa). Over the course of 11 months, 11 medical students followed our annotation methodology, resulting in a question answering dataset of 5696 questions over 71 patient records, of which 1747 questions have corresponding answers generated by the medical students.

研究动机与目标

  • 开发一种可扩展且可复现的方法,从电子病历中生成问答对,以支持患者特定的问答任务。
  • 解决当前缺乏大规模、专家精心筛选的数据集以用于训练和评估临床问答任务中机器学习模型的问题。
  • 通过使用结构化的标注指南和医学生标注者,确保高标注者间一致性。
  • 创建一个支持自然语言处理在临床决策支持和患者参与研究中的数据集。

提出的方法

  • 设计了一套标准化的标注流程,使医学生能够从临床记录中提取问题,并基于患者特定的EHR内容生成答案。
  • 标注者在EHR子集上接受培训,并遵循详细的指南,以确保问题表述和答案生成的一致性。
  • 该过程包括迭代审查和共识建立,以解决分歧并提升标注质量。
  • 使用Cohen's kappa测量标注者间一致性,最终得分为0.71,表明一致性程度较高。
  • 该数据集历时11个月,由11名医学生完成,覆盖71名患者记录。
  • 最终数据集包含5,696个问题和1,747对答案,均由受训医学生精心标注。

实验结果

研究问题

  • RQ1能否开发一种可扩展且可复现的标注流程,利用医学生标注者从电子健康记录中生成问答对?
  • RQ2在临床问答数据集构建任务中,使用结构化指南能否实现较高水平的标注者间一致性?
  • RQ3使用该方法每名患者记录可生成多少个具有临床相关性的问答对?
  • RQ4使用医学生作为标注者在多大程度上能确保生成的问答对具有临床准确性和相关性?
  • RQ5该数据集能否支持患者特定问答任务中机器学习模型的开发与评估?

主要发现

  • 该标注流程实现了0.71的Cohen's kappa评分,表明标注者之间具有高度一致性。
  • 在11个月期间,11名医学生从71名患者记录中生成了总计5,696个问题。
  • 其中1,747个问题配有专家验证的答案,构成高质量的训练与评估资源。
  • 该方法具有可复现性,可由受训医学生在极少临床监督下实施。
  • 所生成的数据集为训练和评估临床问答任务中的机器学习模型提供了宝贵的基准。
  • 该数据集支持医疗领域自然语言处理的研究,尤其在以患者为中心的应用中,如临床决策支持和患者参与。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。