Skip to main content
QUICK REVIEW

[論文レビュー] A Hybrid Citation Retrieval Algorithm for Evidence-based Clinical Knowledge Summarization: Combining Concept Extraction, Vector Similarity and Query Expansion for High Precision

Kalpana Raja, Andrew J. Sauer|arXiv (Cornell University)|Sep 6, 2016
Topic Modeling参考文献 1被引用数 3
ひとこと要約

本論文では、概念抽出、ベクトル類似度、クエリ拡張を統合するハイブリッドキャシオン検索システムを提案し、エビデンスベースの臨床知識要約における関連する医学的キャシオンを精度よく検索することを目的としている。このシステムは、心不全と心房細動のトピックにおいて、それぞれ41.2%および42.4%のFスコアを達成しており、ベースラインを著しく上回っている。また、トピックごとに最大18件の新たな関連キャシオンを検出している。

ABSTRACT

Novel information retrieval methods to identify citations relevant to a clinical topic can overcome the knowledge gap existing between the primary literature (MEDLINE) and online clinical knowledge resources such as UpToDate. Searching the MEDLINE database directly or with query expansion methods returns a large number of citations that are not relevant to the query. The current study presents a citation retrieval system that retrieves citations for evidence-based clinical knowledge summarization. This approach combines query expansion, concept-based screening algorithm, and concept-based vector similarity. We also propose an information extraction framework for automated concept (Population, Intervention, Comparison, and Disease) extraction. We evaluated our proposed system on all topics (as queries) available from UpToDate for two diseases, heart failure (HF) and atrial fibrillation (AFib). The system achieved an overall F-score of 41.2% on HF topics and 42.4% on AFib topics on a gold standard of citations available in UpToDate. This is significantly high when compared to a query-expansion based baseline (F-score of 1.3% on HF and 2.2% on AFib) and a system that uses query expansion with disease hyponyms and journal names, concept-based screening, and term-based vector similarity system (F-score of 37.5% on HF and 39.5% on AFib). Evaluating the system with top K relevant citations, where K is the number of citations in the gold standard achieved a much higher overall F-score of 69.9% on HF topics and 75.1% on AFib topics. In addition, the system retrieved up to 18 new relevant citations per topic when tested on ten HF and six AFib clinical topics.

研究の動機と目的

  • MEDLINEなどの一次医療文献と、UpToDateのような臨床知識リソースとの間の知識ギャップを埋める。
  • 直接MEDLINE検索や基本的なクエリ拡張による、不適切なキャシオンの大量返還を低減する。
  • エビデンスベースの臨床知識要約におけるキャシオン検索の精度を向上させる。
  • 臨床クエリから、主な臨床的概念(対象集団、介入、対照群、疾患)を自動で抽出する。
  • 多段階のフィルタリングとランク付けを通じて再現性と精度を向上させるスケーラブルなハイブリッド検索フレームワークを構築する。

提案手法

  • 情報抽出フレームワークを用いて、臨床クエリからPICO(対象集団、介入、対照群、結果)の臨床的概念を抽出する。
  • 同義語や関連語を用いたクエリ拡張を実施し、精度を損なわずに再現性を向上させる。
  • 概念ベースのベクトル類似度を用いて、クエリの概念とキャシオンの要約間の意味的関連性を計算する。
  • 概念ベースのスクリーニングと用語ベースのベクトル類似度を統合したハイブリッドランク付けモデルを構築する。
  • 概念ベースとベクトルベースの類似度スコアの重み付き融合を用いてキャシオンをランク付けする。
  • 心不全および心房細動のトピックについて、UpToDateのゴールドスタンダードキャシオンセットを用いてシステムのパフォーマンスを評価する。

実験結果

リサーチクエスチョン

  • RQ1概念抽出、クエリ拡張、ベクトル類似度を統合したハイブリッド検索システムは、臨床トピックにおけるキャシオン検索の精度を著しく向上させることができるか?
  • RQ2PICO概念抽出の統合は、従来のキーワードベース手法と比較して、検索パフォーマンスにどのように寄与するか?
  • RQ3クエリ拡張は、臨床キャシオン検索において、高い精度を維持したまま再現性をどの程度向上させるか?
  • RQ4ゴールドスタンダードリファレンスと照合した際のトップ-Kキャシオンの検索において、システムのパフォーマンスはいかがなっているか?
  • RQ5本システムは、既存の臨床知識リソースに存在しない、新たな関連キャシオンを特定できるか?

主な発見

  • 本システムは、心不全トピックで41.2%、心房細動トピックで42.4%のFスコアを達成しており、クエリ拡張のみのベースライン(それぞれ1.3%および2.2%のFスコア)を著しく上回っている。
  • ゴールドスタンダードのカウントと一致するトップ-Kキャシオンを検索した際、心不全では69.9%、心房細動では75.1%のFスコアを達成しており、高優先度の結果において優れたパフォーマンスを示している。
  • UpToDateのゴールドスタンダードに存在しない、トピックごとに最大18件の新たな関連キャシオンを検出しており、新規の証拠を発見する能力を示している。
  • 概念ベースのスクリーニングとベクトル類似度を統合したハイブリッドアプローチは、心不全で37.5%、心房細動で39.5%のFスコアを達成しており、ベースライン手法に比べて段階的な改善が見られた。
  • 概念抽出とベクトル類似度の統合により、キーワードのみまたは拡張のみの戦略と比較して、不適切な結果の削減が顕著に進んだ。
  • 本システムのパフォーマンスは、心不全と心房細動の両方において一貫しており、Fスコアとトップ-K検索の正確性に顕著な向上が見られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。