[论文解读] Assessment of Amazon Comprehend Medical: Medication Information Extraction
本研究使用2009年i2b2和2018年n2c2挑战赛的基准数据集,以及纽约大学朗格尼医学中心的内部临床笔记,评估亚马逊Comprehend Medical(ACM)在从临床笔记中提取药物信息方面的表现。ACM在三项测试中的F1分数分别为0.768、0.828和0.753,分别低于两项挑战赛中表现最佳的系统,表明在真实临床药物信息提取任务中仍有改进空间。
In November 27, 2018, Amazon Web Services (AWS) released Amazon Comprehend Medical (ACM), a deep learning based system that automatically extracts clinical concepts (which include anatomy, medical conditions, protected health information (PH)I, test names, treatment names, and medical procedures, and medications) from clinical text notes. Uptake and trust in any new data product relies on independent validation across benchmark datasets and tools to establish and confirm expected quality of results. This work focuses on the medication extraction task, and particularly, ACM was evaluated using the official test sets from the 2009 i2b2 Medication Extraction Challenge and 2018 n2c2 Track 2: Adverse Drug Events and Medication Extraction in EHRs. Overall, ACM achieved F-scores of 0.768 and 0.828. These scores ranked the lowest when compared to the three best systems in the respective challenges. To further establish the generalizability of its medication extraction performance, a set of random internal clinical text notes from NYU Langone Medical Center were also included in this work. And in this corpus, ACM garnered an F-score of 0.753.
研究动机与目标
- 独立验证亚马逊Comprehend Medical在从临床文本中提取药物信息方面的性能。
- 评估ACM在多样化临床笔记语料库(包括基准数据集和真实世界电子健康记录)中进行药物信息抽取的泛化能力。
- 将ACM的性能与以往药物信息抽取挑战赛中的最先进系统进行基准对比。
- 识别ACM在真实临床环境中进行药物信息抽取时的准确性与可靠性方面的局限性。
提出的方法
- ACM被应用于2009年i2b2药物信息抽取挑战赛和2018年n2c2第2赛道:电子健康记录中的不良药物反应与药物信息抽取的官方测试集。
- 采用标准自然语言处理指标(尤其是F1分数)评估药物实体识别的性能。
- 另使用纽约大学朗格尼医学中心的一组随机临床笔记,以测试其在基准数据集之外的泛化能力。
- 将结果与各挑战赛中排名前三的系统进行对比,以定位ACM的性能表现。
- 评估工作仅聚焦于药物信息抽取,包括药物名称、剂量及相关临床信息。
实验结果
研究问题
- RQ1亚马逊Comprehend Medical在标准化药物信息抽取基准(如2009年i2b2和2018年n2c2挑战赛)上的表现如何?
- RQ2ACM在纽约大学朗格尼医学中心的真实临床笔记语料库上的表现如何?
- RQ3ACM的药物信息抽取准确率与各挑战赛中表现最佳的系统相比如何?
- RQ4ACM在经过精心筛选的基准数据集之外的临床文本上,其泛化能力如何?
主要发现
- 在2009年i2b2药物信息抽取测试集上,ACM的F1分数为0.768,低于该挑战赛中排名前三的系统。
- 在2018年n2c2挑战赛测试集上,ACM的F1分数为0.828,是该竞赛中表现最差的三支顶尖系统之一。
- 在纽约大学朗格尼医学中心内部临床笔记的随机样本评估中,ACM的F1分数为0.753,表明其在真实世界电子健康记录数据上的表现中等。
- 结果表明,尽管ACM在基准数据集上表现尚可,但在两项挑战赛设置中,其性能仍落后于最先进系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。