[論文レビュー] PDD Graph: Bridging Electronic Medical Records and Biomedical Knowledge Graphs via Entity Linking
本稿では、MIMIC-IIIの電子的医療記録(EMR)とバイオメディカル知識グラフ(DrugBankおよびICD-9)をエンティティリンキングを通じて接続する大規模かつ高品質な異種知識グラフ、PDD Graphを紹介する。58,030のエンティティと230万のRDF三元組を抽出・リンクし、エンティティリンキングで94%の正確性と85%の再現率を達成した。PDD Graphは、公開のSPARQLエンドポイントを介して、治療提案や薬物相互作用分析といった高度な臨床的発見を可能にする。
Electronic medical records contain multi-format electronic medical data that consist of an abundance of medical knowledge. Facing with patient's symptoms, experienced caregivers make right medical decisions based on their professional knowledge that accurately grasps relationships between symptoms, diagnosis and corresponding treatments. In this paper, we aim to capture these relationships by constructing a large and high-quality heterogenous graph linking patients, diseases, and drugs (PDD) in EMRs. Specifically, we propose a novel framework to extract important medical entities from MIMIC-III (Medical Information Mart for Intensive Care III) and automatically link them with the existing biomedical knowledge graphs, including ICD-9 ontology and DrugBank. The PDD graph presented in this paper is accessible on the Web via the SPARQL endpoint, and provides a pathway for medical discovery and applications, such as effective treatment recommendations.
研究の動機と目的
- 臨床データがEMRに記録されているのに対し、バイオメディカル知識グラフに統合されていないというギャップを埋めるために、患者レベルのデータと構造化された医療事実を統合すること。
- 単独のバイオメディカルKGでは欠落している、薬物、疾患、患者の治療結果の間の臨床的に関連する関係を発見すること。
- 研究利用を目的として、MIMIC-IIIのエンティティをDrugBankおよびICD-9オントロジーにリンクする高品質でオープンアクセス可能なPDDグラフデータセットを構築すること。
- 研究者がEMRとバイオメディカル知識グラフの間の関係を探索できるように、SPARQLエンドポイントを提供すること。
- 新しいフレームワークを用いて、EMRのテキストと外部知識ソースとの間のエンティティリンキングの正確性と有用性を向上させること。
提案手法
- 臨床ノート、処方、診断を用いてMIMIC-IIIから医療エンティティ(患者、薬物、疾患)を抽出する。
- 文字列マッチングと文脈に配慮した意味の解消を用いて、エンティティリンキングモデル(ENM)を適用し、抽出されたエンティティをDrugBankおよびICD-9オントロジーの対応するエンティティにマッピングする。
- PDD定義を用いて、得られた知識をRDFグラフとして表現し、患者-薬物および患者-疾患関係を表す三元組を生成する。
- Apache Jena Fusekiを用いたSPARQLエンドポイントを活用し、PDDグラフをプログラム的アクセスおよびフェデレーテッドクエリに利用可能にする。
- 500件のサンプルを手動で検証することでエンティティリンキングの正確性を評価し、94%の正確性と85%の再現率を達成した。
- エッジケース(例:非標準の薬物名「NS」、短い識別子「N」など)に対処するため、エラー分析とデータキュレーションを実施した。
実験結果
リサーチクエスチョン
- RQ1MIMIC-IIIの臨床的エンティティは、DrugBankやICD-9といった既存のバイオメディカル知識グラフに正確にリンク可能か?
- RQ2EMR由来の患者データは、構造化されたバイオメディカル知識とどの程度統合可能であり、臨床的に意味のある関係を明らかにできるか?
- RQ3提案されたエンティティリンキングモデルは、多様な臨床用語を標準化されたバイオメディカルオントロジーにマッピングする上でどの程度有効か?
- RQ4エンティティリンキングおよび三元組生成の観点から、生成されたPDDグラフのカバレッジと品質はどの程度か?
- RQ5統合されたPDDグラフは、治療提案や薬物相互作用分析といった高度な臨床応用を支援できるか?
主な発見
- PDD Graphには58,030のエンティティと230万のRDF三元組が含まれており、患者、薬物、疾患を結ぶ大規模かつ異種の知識グラフを形成している。
- MIMIC-IIIの服用薬物記録の83.4%がDrugBankに正常にリンクされ、4,525種の薬物のうち3,449種がマッチングされた。
- 診断済み疾患の99.9%がICD-9オントロジーにリンクされ、未マッチングのコードは2つ(「71970」および「NULL」)にとどまった。
- 手動検証の500件サンプルにおいて、エンティティリンキングモデルは94%の正確性と85%の再現率を達成した。
- 200件のランダムに選択されたリンクを対象とした別々の手動評価でも、エンティティの正確性は93%で確認された。
- 主なリンクの課題は、非標準の薬物名(例:「NS」)および短い識別子(例:「N」)に起因し、正確なマッピングに必要な文脈が不足していた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。