Skip to main content
QUICK REVIEW

[論文レビュー] Survey of Text-based Epidemic Intelligence: A Computational Linguistic Perspective

Aditya Joshi, Sarvnaz Karimi|arXiv (Cornell University)|Mar 14, 2019
Data-Driven Disease Surveillance参考文献 61被引用数 3
ひとこと要約

本調査は、テキストベースの疫学的インテリジェンスのための計算言語学的フレームワークを提示し、アプローチを健康関連記述分類(疾患関連のテキストを特定する)と健康イベント検出(時間的・空間的変動を追跡する)に分類する。自然言語処理(NLP)技術、アノテーションリソース、評価戦略をレビューし、誤検知の低減、近似リアルタイム検出、身体的・精神的・動物由来の健康分野における重複する症候群の統合という分野における主な研究ギャップを特定する。

ABSTRACT

Epidemic intelligence deals with the detection of disease outbreaks using formal (such as hospital records) and informal sources (such as user-generated text on the web) of information. In this survey, we discuss approaches for epidemic intelligence that use textual datasets, referring to it as `text-based epidemic intelligence'. We view past work in terms of two broad categories: health mention classification (selecting relevant text from a large volume) and health event detection (predicting epidemic events from a collection of relevant text). The focus of our discussion is the underlying computational linguistic techniques in the two categories. The survey also provides details of the state-of-the-art in annotation techniques, resources and evaluation strategies for epidemic intelligence.

研究の動機と目的

  • ウェブからの非公式なテキストデータを用いて、テキストベースの疫学的インテリジェンスに関する包括的な計算言語学的視点を提供すること。
  • ソーシャルメディアやニュースなどの非構造的テキストを用いて、疾患の流行を早期に検出するという課題に対処すること。
  • 誤検知の低減、タイムリーな対応の向上、重複する症候群のカバー範囲の拡大という点での研究ギャップを特定すること。
  • 健康関連記述およびイベント検出のための、既存のアノテーションリソース、評価戦略、最先端のNLP技術を評価すること。

提案手法

  • テキストベースの疫学的インテリジェンスを2段階に分類する:健康関連記述分類(個々のテキスト内での疾患関連コンテンツの検出)と健康イベント検出(時間的・空間的変動を考慮した関連テキストの集約・分析)。
  • 医療オントロジー、統計的分類器、トピックモデル、ニューラルネットワークなどの計算言語学的技術を、健康関連記述分類に適用する。
  • 時間的・空間的疾患の流行を検出するために、指数加重移動平均を含む時系列および空間分析手法を適用する。
  • 標準的な指標を用いて性能を評価し、NLPコンponentsにおけるタスク固有の特徴とパイプライン統合の重要性を強調する。
  • 正確性の向上と誤検知の低減を目的として、比喩的言語検出とスパムフィルタリングの統合を提案する。
  • 共通の症状モデリングを通じて、身体的疾患、精神的健康、動物由来疾患の監視を統合する可能性を検討する。

実験結果

リサーチクエスチョン

  • RQ1計算言語学的技術は、非構造的テキストからの疾患の流行検出の正確性と効率をどのように向上させることができるか?
  • RQ2ソーシャルメディアにおける、直接的な健康関連記述と比喩的・臨床的でない言語を区別する主な課題は何か?
  • RQ3健康イベント検出システムは、早期の公衆衛生対応を可能にするために、どのように近似リアルタイム性能を達成できるか?
  • RQ4身体的・精神的・動物由来の健康分野における重複する症候群や症状を、どのようにモデリングすることで監視カバレッジを向上させられるか?
  • RQ5医療オントロジーと構造化された知識ベースは、テキストベースの疫学的インテリジェンスシステムの性能向上にどのような役割を果たすか?

主な発見

  • 初期の疫学的報告の60%以上が、ソーシャルメディアやオンラインフォーラムなどの非公式なテキストベースのソースから出ている。
  • 医療オントロジーとタスク固有の特徴の使用により、健康関連記述分類の精度が顕著に向上する。
  • 個人の健康関連記述検出の前にターゲット同定を統合することで、下流の健康イベント検出のパフォーマンスが向上する。
  • 誤検知は依然として大きな課題であり、特にソーシャルメディアにおける比喩的言語とスパムの影響により、より優れたフィルタリング技術の必要性が高まっている。
  • ソーシャルメディアデータを用いた近似リアルタイムの流行検出は可能であるが、データ統合とイベントモデリングにおける課題は依然として残っている。
  • 今後の疫学的インテリジェンスシステムは、共通の症状パターンをモデリングすることで、精神的健康や動物由来疾患といった関連する症候群を統合すべきである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。