[論文レビュー] OMG U got flu? Analysis of shared health messages for bio-surveillance
本稿では、ツイート文に記載された自己防護行動(人混みを避ける、衛生習慣を高めるなど)を、感染症の流行をリアルタイムで監視する指標として使用することを提案している。unigram、bigram、正規表現を特徴量として用いた教師あり学習により、著者らはツイートを4つの防護行動カテゴリと1つの診断カテゴリに分類し、高い評価者間一致度(kappa = 0.86)を達成した。また、公式のWHO/NREVSSインフルエンザデータとの間に中程度の相関(スピアマンのrho)を示し、ソーシャルメディアが感染症の流行を低コストで早期に警告する手段として有効であることを裏付けた。
Background: Micro-blogging services such as Twitter offer the potential to crowdsource epidemics in real-time. However, Twitter posts ('tweets') are often ambiguous and reactive to media trends. In order to ground user messages in epidemic response we focused on tracking reports of self-protective behaviour such as avoiding public gatherings or increased sanitation as the basis for further risk analysis. Results: We created guidelines for tagging self protective behaviour based on Jones and Salathé (2009)'s behaviour response survey. Applying the guidelines to a corpus of 5283 Twitter messages related to influenza like illness showed a high level of inter-annotator agreement (kappa 0.86). We employed supervised learning using unigrams, bigrams and regular expressions as features with two supervised classifiers (SVM and Naive Bayes) to classify tweets into 4 self-reported protective behaviour categories plus a self-reported diagnosis. In addition to classification performance we report moderately strong Spearman's Rho correlation by comparing classifier output against WHO/NREVSS laboratory data for A(H1N1) in the USA during the 2009-2010 influenza season. Conclusions: The study adds to evidence supporting a high degree of correlation between pre-diagnostic social media signals and diagnostic influenza case data, pointing the way towards low cost sensor networks. We believe that the signals we have modelled may be applicable to a wide range of diseases.
研究の動機と目的
- ソーシャルメディアにおける自己防護行動を、感染症の流行の早期兆候として特定する手法を開発すること。
- 自己診断に偏る傾向やメディアに影響を受ける性質を持つインフルエンザ関連ツイートの曇りを解消するため、自己診断ではなく行動反応に焦点を当てる。
- ツイッターのデータにおける防護行動を分類する信頼性の高いアノテーションフレームワークを構築すること。
- ソーシャルメディアの信号と公式のインフルエンザ監視データとの相関を評価すること。
提案手法
- JonesとSalathé(2009)の研究に基づき、5,283件のインフルエンザ関連ツイートに対して自己防護行動をラベル付けするためのアノテーションガイドラインを開発した。
- SVMおよびナイーブベイズ分類器を用い、unigram、bigram、正規表現を特徴量として教師あり学習を実施した。
- ツイートを4つの防護行動カテゴリと1つの自己報告診断カテゴリに分類した。
- CohenのKappa係数を用いて評価者間一致度を測定し、0.86という高い値を達成した。
- 2009–2010年のシーズンにおける分類器の出力と、WHO/NREVSSによる確定されたA(H1N1)インフルエンザデータの間のスピアマンのrho相関を比較した。
- 流行の傾向を代理指標として行動信号をモデル化するために、リアルタイムのツイートデータを収集したコーパスを活用した。
実験結果
リサーチクエスチョン
- RQ1自然言語処理技術を用いて、ソーシャルメディアに表れる自己防護行動を信頼性高く検出・分類できるか?
- RQ2検出された行動信号は、公式のインフルエンザ監視データとどの程度相関しているか?
- RQ3ソーシャルメディアにおける自己防護健康行動をラベル付けする際、人間のアノテーター間でどの程度の一致度が達成できるか?
- RQ4行動反応に基づくソーシャルメディア信号は、従来の感染症監視システムの低コスト代替手段として機能できるか?
- RQ5自己防護行動に関するソーシャルメディアのトレンドは、公式のインフルエンザ患者報告をどの程度事前に反映しているか?
主な発見
- アノテーションスキームは、CohenのKappa係数が0.86に達するほど高い評価者間一致度を示し、防護行動のラベル付けにおける信頼性が確認された。
- SVMおよびナイーブベイズ分類器を用いた教師あり学習は、4つの防護行動カテゴリと自己報告診断との区別を効果的に実行できた。
- 分類器の出力と公式のWHO/NREVSS A(H1N1)確定データとの間に、中程度のが統計的に有意なスピアマンのrho相関が観察された。
- 本研究では、診断前のソーシャルメディア信号(行動反応に基づくもの)が、現実世界の感染症トレンドと相関していることが示された。
- 結果として、流行の検出に向けた低コストでリアルタイムのセンサーネットワークとしてソーシャルメディアを活用する可能性が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。