[論文レビュー] Assessment of Amazon Comprehend Medical: Medication Information Extraction
本研究では、2009年i2b2および2018年n2c2チャレンジのベンチマークデータセット、および内部のNYUランゴン臨床ノートを用いて、Amazon Comprehend Medical(ACM)の薬物情報抽出性能を評価した。ACMはそれぞれFスコア0.768、0.828、0.753を達成し、両チャレンジの最上位システムより低い順位にとどまり、実臨床環境における薬物抽出タスクにおける改善の余地が示された。
In November 27, 2018, Amazon Web Services (AWS) released Amazon Comprehend Medical (ACM), a deep learning based system that automatically extracts clinical concepts (which include anatomy, medical conditions, protected health information (PH)I, test names, treatment names, and medical procedures, and medications) from clinical text notes. Uptake and trust in any new data product relies on independent validation across benchmark datasets and tools to establish and confirm expected quality of results. This work focuses on the medication extraction task, and particularly, ACM was evaluated using the official test sets from the 2009 i2b2 Medication Extraction Challenge and 2018 n2c2 Track 2: Adverse Drug Events and Medication Extraction in EHRs. Overall, ACM achieved F-scores of 0.768 and 0.828. These scores ranked the lowest when compared to the three best systems in the respective challenges. To further establish the generalizability of its medication extraction performance, a set of random internal clinical text notes from NYU Langone Medical Center were also included in this work. And in this corpus, ACM garnered an F-score of 0.753.
研究の動機と目的
- Amazon Comprehend Medicalの臨床テキストからの薬物情報抽出性能を独立して検証すること。
- ACMの薬物抽出性能が、ベンチマークデータセットおよび実臨床EHRを含む多様な臨床ノートコーパスに一般化できるかを評価すること。
- 過去の薬物抽出チャレンジにおける最先端システムと比較して、ACMの性能をベンチマーク化すること。
- 実臨床環境における臨床薬物抽出の文脈で、ACMの正確性および信頼性の限界を特定すること。
提案手法
- ACMは、2009年i2b2薬物抽出チャレンジおよび2018年n2c2トラック2:EHRにおける有害薬物反応および薬物抽出の公式テストセットに適用された。
- 薬物エンティティ認識のための標準的NLPメトリクス、特にF1スコアを用いて性能を評価した。
- ベンチマークデータセット以外の一般化性能を検証するために、NYUランゴン医療センターのランダムな臨床ノートの別セットが使用された。
- ACMの性能をそれぞれのチャレンジで上位3位のシステムと比較して文脈化した。
- 評価は薬物抽出に限定され、薬剤名、用量、関連する臨床情報が含まれた。
実験結果
リサーチクエスチョン
- RQ1Amazon Comprehend Medicalは、i2b2 2009年およびn2c2 2018年のような標準化された薬物抽出ベンチマークでどのように性能を発揮するか?
- RQ2ACMはNYUランゴン医療センターの実臨床ノートコーパスでどの程度の性能を示すか?
- RQ3ACMの薬物抽出精度は、それぞれのチャレンジにおける上位システムと比べてどの程度か?
- RQ4ACMは、キュレートされたベンチマークデータセット以外の臨床テキストにもどの程度一般化できるか?
主な発見
- ACMは2009年i2b2薬物抽出テストセットでFスコア0.768を達成し、当該チャレンジの上位3システムより低い順位にとどまった。
- 2018年n2c2チャレンジテストセットでは、ACMはFスコア0.828を達成したが、同競技会で上位3位のシステムの中では最低のスコアであった。
- NYUランゴン医療センターの内部臨床ノートのランダムサンプルに対する評価では、ACMはFスコア0.753を達成し、実臨床EHRデータ上での中程度の性能を示した。
- 結果から、ACMはベンチマークデータセット上では妥当な性能を示すが、両チャレンジ設定においても最先端システムに劣ることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。