Skip to main content
QUICK REVIEW

[論文レビュー] Towards using social media to identify individuals at risk for preventable chronic illness

Dane Bell, Daniel Fried|arXiv (Cornell University)|Mar 11, 2016
Sentiment Analysis and Opinion Mining参考文献 28被引用数 4
ひとこと要約

本論文では、Twitterデータから得た訓練済みランダムフォレスト分類器を用いて、個々の公衆衛生データを収集するための半自動化されたツールに変換したゲーム形式のクイズを提案する。このクイズは、食事や言語関連の質問を用いて2型糖尿病のリスクにさらされている個人を特定することを目的としており、BMI分類において78.7%の正確性を達成したが、サンプルバイアスのため、肥満とされる参加者では性能が著しく低下した。

ABSTRACT

We describe a strategy for the acquisition of training data necessary to build a social-media-driven early detection system for individuals at risk for (preventable) type 2 diabetes mellitus (T2DM). The strategy uses a game-like quiz with data and questions acquired semi-automatically from Twitter. The questions are designed to inspire participant engagement and collect relevant data to train a public-health model applied to individuals. Prior systems designed to use social media such as Twitter to predict obesity (a risk factor for T2DM) operate on entire communities such as states, counties, or cities, based on statistics gathered by government agencies. Because there is considerable variation among individuals within these groups, training data on the individual level would be more effective, but this data is difficult to acquire. The approach proposed here aims to address this issue. Our strategy has two steps. First, we trained a random forest classifier on data gathered from (public) Twitter statuses and state-level statistics with state-of-the-art accuracy. We then converted this classifier into a 20-questions-style quiz and made it available online. In doing so, we achieved high engagement with individuals that took the quiz, while also building a training set of voluntarily supplied individual-level data for future classification.

研究の動機と目的

  • 慢性疾患リスク予測のための個別レベルの公衆衛生データを収集する課題に取り組むこと、特に予防可能な疾患である2型糖尿病に対して。
  • 従来の健康調査における参加意欲の低さやプライバシー上の懸念を克服するため、侵襲的でないゲーム形式のクイズ形式を採用すること。
  • コミュニティレベルのSNS分析と個別レベルのリスク予測の間のギャップを埋めるために、半自動化されたデータ収集手法を活用すること。
  • SNSを介して匿名化された個別健康データ(例:BMI、人口統計学的属性)を収集するスケーラブルで低コストな手法を開発すること。
  • 予防可能な慢性疾患にかかりやすい個人を同定するための教師あり分類器をトレーニングするための公開データセットを構築すること。

提案手法

  • 公共のTwitterデータと州レベルの肥満統計を用いてランダムフォレスト分類器をトレーニングし、米国州を平均BMI以上または未満に分類する作業を実施した。これにより、以前のモデルよりも2%高い正確性を達成した。
  • トレーニング済みランダムフォレストの意思決定ノードを自動的に自然言語の質問に変換し、20の質問形式のクイズを構築した。
  • クイズをオンラインで配信し、参加者から自発的に提供された匿名データ(自報された体重・身長・年齢・性別・Twitterハンドルなど)を収集した。
  • プライバシー上の懸念を避けるために、食事や関連する言語に関する間接的で楽しくて遊び心のある質問を用いた。
  • クイズの結果を用いてモデルの性能を評価し、今後の個別レベルの分類のための代表的なトレーニングデータセットを構築した。
  • 回答、予測結果、人口統計学的属性を含む匿名化されたクイズデータは、研究利用のために公開された。

実験結果

リサーチクエスチョン

  • RQ1SNS分類器から導出した半自動化されたクイズが、高い関与度を伴って個別レベルの健康データを効果的に収集できるか。
  • RQ2州レベルのSNSデータでトレーニングされたモデルが、個別レベルのBMIを分類するためにどの程度転送可能か。
  • RQ3クイズベースのデータ収集手法における参加者の関与度は、従来の公衆衛生調査と比べてどの程度高いか。
  • RQ4BMIが28.7以上(肥満基準)の個人を分類する際のクイズの性能はいかが。
  • RQ5SNS上での食事や言語使用に関する間接的・非侵襲的な質問が、個人のBMIを許容できる正確性で予測できるか。

主な発見

  • クイズは参加者のBMIを米国平均と比較して全体で78.7%の正確性で分類したが、これはサンプルバイアスによって著しく歪められていた。
  • BMIが28.7以上(肥満)の参加者に対しては、正確性が16.0%に低下し、トレーニングデータにおける代表が不足していることによる、肥満者の検出能力の低さが示された。
  • 研究参加者は米国成人平均(47.1歳、167cm、80.3kg、BMI 28.6)と比較して、顕著に若く(26.1歳)、短く(173cm)、軽く(74.4kg)、BMIが低い(24.9)ことが分かった。
  • サンプルバイアスが極めて深刻なため、「全参加者を肥満でない」と予測するだけでも82.3%の正確性が達成可能であり、より良いデータ収集の必要性が浮き彫りになった。
  • バイアスの影響にもかかわらず、クイズは高い関与度を示し、945名中926名が、BMI、人口統計学的属性、Twitterハンドルなどの補足データを自発的に提供した。
  • 匿名化されたクイズデータ(回答、予測結果、個人情報など)は、今後の研究を目的として公開された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。