Skip to main content
QUICK REVIEW

[論文レビュー] Crowdbreaks: Tracking Health Trends using Public Social Media Data and Crowdsourcing

Martin Mueller, Marcel Salathé|arXiv (Cornell University)|May 14, 2018
Data-Driven Disease Surveillance参考文献 21被引用数 3
ひとこと要約

Crowdbreaks は、主に Twitter を含む公開ソーシャルメディアデータのクラウドソーシングによるラベリングを活用し、アクティブラーニングと継続的なモデル再訓練を用いて、健康トレンドをリアルタイムで追跡するオープンでリアルタイムのプラットフォームです。データ収集、フィルタリング、ラベリング、分類器のトレーニングを自動化することで、コンセプトドリフトや高額なラベリングコストの問題を解決し、動的で透明性があり再利用可能な公衆衛生監視ツールを実現します。実際にワクチンの感情や疾患関連トレンドの監視において実用性が確認されています。

ABSTRACT

In the past decade, tracking health trends using social media data has shown great promise, due to a powerful combination of massive adoption of social media around the world, and increasingly potent hardware and software that enables us to work with these new big data streams. At the same time, many challenging problems have been identified. First, there is often a mismatch between how rapidly online data can change, and how rapidly algorithms are updated, which means that there is limited reusability for algorithms trained on past data as their performance decreases over time. Second, much of the work is focusing on specific issues during a specific past period in time, even though public health institutions would need flexible tools to assess multiple evolving situations in real time. Third, most tools providing such capabilities are proprietary systems with little algorithmic or data transparency, and thus little buy-in from the global public health and research community. Here, we introduce Crowdbreaks, an open platform which allows tracking of health trends by making use of continuous crowdsourced labelling of public social media content. The system is built in a way which automatizes the typical workflow from data collection, filtering, labelling and training of machine learning classifiers and therefore can greatly accelerate the research process in the public health domain. This work introduces the technical aspects of the platform and explores its future use cases.

研究の動機と目的

  • コンセプトドリフトや古くなったトレーニングデータに苦しむ、静的で再利用不可な NLP モデルの限界を解消すること。
  • 継続的でクラウドソーシングされたラベリングパイプラインを導入することで、手作業によるデータラベリングの高コストと非効率性を低減すること。
  • 公衆衛生機関や研究者によるリアルタイムでマルチクラスの健康トレンド監視を可能にする、透明性がありオープンなプラットフォームを構築すること。
  • 進化するソーシャルメディア上の健康行動や感情を追跡するための柔軟で再利用可能で最新の機械学習モデルを実現すること。
  • スケーラブルな人間を含むラベリングを通じて、ワクチン接種のためのためらいや疾患の症状といった、細分化された健康関連コンテンツの分類を支援すること。

提案手法

  • プラットフォームは、健康関連のトピックをキーワードベースでフィルタリングすることで、リアルタイムの Twitter データを収集するストリーミングパイプラインを用いる。
  • 予測の不確実性が高く、最新の時系列的関連性があるツイートを優先してラベリングする、アクティブラーニングフレームワークを実装する。
  • Ruby on Rails と PostgreSQL を使用して構築されたウェブベースのユーザインターフェースを通じて、クラウドソーシングされたアノテーションを収集し、スケーラブルなデータラベリングを可能にする。
  • ラベル付きデータを用いて、感情分析に fastText を用いたような教師あり機械学習分類器を継続的に再訓練するフィードバックループを構築する。
  • データストレージには Elasticsearch を、可視化には Kibana を使用し、Redis をメッセージキューイングおよび優先度管理に統合する。
  • Flask API を介してストリーミングパイプラインとユーザインターフェースを接続し、リアルタイムのデータフローとモデルの更新を実現する。

実験結果

リサーチクエスチョン

  • RQ1継続的でリアルタイムのソーシャルメディアデータラベリングは、健康トレンド検出モデルの頑健性と再利用可能性をどのように向上させるか?
  • RQ2不確実性サンプリングを用いたアクティブラーニングは、公衆衛生監視において、ラベリングコストを低減しつつも、モデルのパフォーマンスを維持または向上させることができるか、その程度は?
  • RQ3Google Flu Trends のような特許を取得したシステムの限界を、オープンで透明性があり、コミュニティ主導のプラットフォームである Crowdbreaks が克服できるか?
  • RQ4プラットフォームは、リアルタイムでワクチン接種のためのためらいといった、洗練された健康関連の感情をどれほど効果的に捉えられるか?
  • RQ5時系列的関連性とラベルの不確実性は、動的なソーシャルメディア環境におけるデータラベリングとモデルトレーニングの効率性にどのような影響を与えるか?

主な発見

  • Crowdbreaks は、継続的なデータ収集とアクティブラーニングに基づくラベリングにより、ワクチンの感情といったリアルタイムでの健康トレンドの追跡を可能にしている。
  • 新しくラベリングされたデータでモデルを再訓練することで、コンセプトドリフトを効果的に緩和し、長期的なモデルパフォーマンスと再利用可能性を向上させた。
  • 不確実性が高く、最新のデータを優先することで、ランダムサンプリングに比べてラベリングコストを削減し、ラベリングの効率性を向上させた。
  • クラウドソーシングされたラベルでトレーニングされた fastText 分類器は、ワクチン関連ツイートのリアルタイム感情分類において安定したパフォーマンスを示した。
  • プラットフォームのアーキテクチャは、スケーラブルで透明性があり拡張性のある公衆衛生監視を可能にし、Wikipedia のクリックレートなどの他のデータソースとの統合によるハイブリッド疾患予測への応用の可能性を秘めている。
  • 本システムは、大規模でマルチクラスのアノテーションを実現し、細分化された公衆衛生監視を可能にする実用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。