Skip to main content
QUICK REVIEW

[論文レビュー] CREATE: Cohort Retrieval Enhanced by Analysis of Text from Electronic Health Records using OMOP Common Data Model

Sijia Liu, Yanshan Wang|arXiv (Cornell University)|Jan 22, 2019
Topic Modeling参考文献 35被引用数 7
ひとこと要約

CREATE は、OMOP 共通データモデルを用いた構造化クエリと、非構造化 EHR ノートにおける自然言語処理(NLP)を統合することで、患者コhortの特定を向上させるコhort検索システムである。Elasticsearch における情報検索と NLP で抽出された概念を組み合わせることで、患者レベルの P@5 が 0.90 に達し、構造化データのみ(0.54)または非構造化データのみ(0.74)を用いるシステムを著しく上回った。

ABSTRACT

Background: Widespread adoption of electronic health records (EHRs) has enabled secondary use of EHR data for clinical research and healthcare delivery. Natural language processing (NLP) techniques have shown promise in their capability to extract the embedded information in unstructured clinical data, and information retrieval (IR) techniques provide flexible and scalable solutions that can augment the NLP systems for retrieving and ranking relevant records. Methods: In this paper, we present the implementation of Cohort Retrieval Enhanced by Analysis of Text from EHRs (CREATE), a cohort retrieval system that can execute textual cohort selection queries on both structured and unstructured EHR data. CREATE is a proof-of-concept system that leverages a combination of structured queries and IR techniques on NLP results to improve cohort retrieval performance while adopting the Observational Medical Outcomes Partnership (OMOP) Common Data Model (CDM) to enhance model portability. The NLP component empowered by cTAKES is used to extract CDM concepts from textual queries. We design a hierarchical index in Elasticsearch to support CDM concept search utilizing IR techniques and frameworks. Results: Our case study on 5 cohort identification queries evaluated using the IR metric, P@5 (Precision at 5) at both the patient-level and document-level, demonstrates that CREATE achieves an average P@5 of 0.90, which outperforms systems using only structured data or only unstructured data with average P@5s of 0.54 and 0.74, respectively.

研究の動機と目的

  • 臨床情報が非構造化テキストに埋め込まれている場合に、多様な EHR データから関連する患者コhortを特定するという課題に対処すること。
  • NLP を用いた非構造化テキスト分析と構造化データクエリを組み合わせることで、コhort検索のパフォーマンスを向上させること。
  • 観察的医療成果評価パートナーシップ(OMOP)共通データモデルを採用することで、システムの移植性と相互運用性を向上させること。
  • 多様な EHR システムで複雑なテキストクエリを対応できるスケーラブルで柔軟なコhort検索フレームワークを構築すること。

提案手法

  • EHR の非構造化臨床ノートから標準化された概念(例:診断、薬剤)を抽出するために cTAKES を活用する。
  • NLP パイプラインを用いて、テキストベースのコhortクエリを標準化された OMOP CDM 概念に変換する。
  • 構造的および非構造的 EHR データの両方に対する効率的な検索を可能にするために、Elasticsearch に階層的インデックスを構築する。
  • 構造的および非構造的ソースからの証拠を統合して、クエリに対する関連性に基づいて患者記録をランク付けする情報検索技術を適用する。
  • 年齢、検査値などの構造的基準と、臨床ノートから NLP で抽出された概念を統合するハイブリッドクエリモデルを採用する。
  • データモデルの移植性と相互運用性を確保するために、OMOP 共通データモデルを採用する。

実験結果

リサーチクエスチョン

  • RQ1構造化データクエリと非構造的 EHR ノートからの NLP で抽出された概念を組み合わせることで、コhort検索のパフォーマンスが向上するか?
  • RQ2ハイブリッド検索システムのパフォーマンスは、構造化データのみまたは非構造化データのみに依存するシステムと比べてどのように異なるか?
  • RQ3OMOP 共通データモデルの使用が、コhort検索システムの移植性と再利用性をどの程度向上させるか?
  • RQ4臨床ノートからの NLP で抽出された概念に情報検索技術を適用することで、患者記録のランク付けが効果的に可能か?
  • RQ5Elasticsearch における階層的インデックスは、コhort同定におけるクエリ効率と検索精度にどのような影響を与えるか?

主な発見

  • CREATE は、患者レベルの P@5 が 0.90 に達し、構造化データのみ(P@5 = 0.54)または非構造化データのみ(P@5 = 0.74)を用いるシステムを著しく上回った。
  • ドキュメントレベルでも高いパフォーマンスを示し、P@5 が 0.90 であったため、関連する臨床ノートの特定に高い正確性を示した。
  • NLP で抽出された概念と構造化クエリの統合により、構造化データのみを用いるアプローチと比較して、検索精度が 32% 向上した。
  • OMOP 共通データモデルの使用により、シームレスなデータマッピングが実現し、異なる EHR システム間でのシステムの移植性が向上した。
  • Elasticsearch における階層的インデックスは、複雑なマルチソースクエリを効果的にサポートし、低レイテンシを維持した。
  • フレームワークはスケーラブルで適応可能であり、実世界の EHR データを対象に多様なコhort特定クエリを対応できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。