Skip to main content
QUICK REVIEW

[論文レビュー] Social Media Image Analysis for Public Health

Kiran Garimella, Abdulrahman Alfayad|arXiv (Cornell University)|Dec 14, 2015
Data-Driven Disease Surveillance参考文献 24被引用数 9
ひとこと要約

本研究では、ユーザーが提供したタグと機械学習で生成された画像タグの両方を用いた、位置情報が付加されたInstagram画像が、郡レベルの公衆衛生統計を予測できるかを調査している。ユーザーのタグは一般的に機械生成タグを上回るが、『液体』や『ガラス』といった機械生成タグは、過剰飲酒の予測において優れた性能を示しており、これは機械生成タグがテキストだけでは見えない、差別的とされる健康行動を明らかにできることを示唆している。

ABSTRACT

Several projects have shown the feasibility to use textual social media data to track public health concerns, such as temporal influenza patterns or geographical obesity patterns. In this paper, we look at whether geo-tagged images from Instagram also provide a viable data source. Especially for "lifestyle" diseases, such as obesity, drinking or smoking, images of social gatherings could provide information that is not necessarily shared in, say, tweets. In this study, we explore whether (i) tags provided by the users and (ii) annotations obtained via automatic image tagging are indeed valuable for studying public health. We find that both user-provided and machine-generated tags provide information that can be used to infer a county's health statistics. Whereas for most statistics user-provided tags are better features, for predicting excessive drinking machine-generated tags such as "liquid" and "glass" yield better models. This hints at the potential of using machine-generated tags to study substance abuse.

研究の動機と目的

  • 位置情報が付加されたInstagram画像が、公衆衛生の監視に有用なデータソースとして機能するかどうかを評価すること。
  • 郡レベルの健康統計における、ユーザーが提供したタグと深層学習を用いた機械生成タグの予測性能を比較すること。
  • 自動画像タグ付けが、ユーザーが明示的にラベル付けしない健康関連行動、とくに物質乱用のような差別的とされる状態を明らかにできるかどうかを評価すること。
  • 肥満、飲酒、運動不足のような生活習慣病を視覚的データを用いて研究する可能性を検討すること。

提案手法

  • 本研究では、米国の郡から得られた位置情報が付加されたInstagram画像を用い、ユーザーが付与したハッシュタグと、Imagga APIを介して生成された機械生成タグを抽出した。
  • 回帰モデルを用いて、画像タグと人口統計データ(例:人種、収入、教育水準)の組み合わせを用いて、郡レベルの健康統計を予測した。
  • モデルの性能は、ピアソン積率相関係数(r)と平均絶対誤差(MAE)を用いて評価され、画像タグを含むモデルと含まないモデルを比較した。
  • 特徴量の重要性は、個々のタグと健康結果との間の絶対相関を計算することで分析され、最も予測に寄与する視覚的特徴が同定された。
  • モデルは郡レベルのデータセットを用いて訓練およびテストされ、妥当性を確保するため交差検証が実施された。
  • 畳み込みニューラルネットワーク(CNN)を含む深層学習ベースの画像認識技術を用いて、『液体』、『飲料』、『ガラス』などのタグを画像の内容から生成した。

実験結果

リサーチクエスチョン

  • RQ1位置情報が付加されたInstagram画像に付与されたユーザーのハッシュタグは、人口統計データのみを用いた場合に比べ、郡レベルの公衆衛生統計をより正確に予測できるか?
  • RQ2深層学習モデルから生成された機械生成タグは、ユーザーが提供したタグを超えて、公衆衛生指標の予測に追加の予測力を与えるか?
  • RQ3過剰飲酒のような差別的とされる行動を含め、どの健康指標において、機械生成タグがユーザー提供タグを上回るか?
  • RQ4『ガラス』や『液体』といった特定の視覚的コンセプトは、画像データにおいて物質乱用の指標を予測する上で、どれほど予測に寄与するか?
  • RQ5画像ベースの特徴量は、テキストベースのSNSデータでは捉えきれない、生活習慣病関連の行動パターンを明らかにできるか?

主な発見

  • 大多数の健康統計について、ユーザーが提供したハッシュタグを用いたモデルは、人口統計データのみを用いたモデルを上回った。ピアソン積率相関係数(r)の向上幅は0.46から0.84の範囲にのぼった。
  • 過剰飲酒の予測において、機械生成タグ(例:『液体』、『飲料』、『ガラス』)はユーザーが提供したタグを顕著に上回り、ピアソン積率相関係数(r)は0.48を記録した。これに対してユーザータグのみでは0.22にとどまった。
  • 機械生成タグを用いたモデルは、過剰飲酒の予測において平均絶対誤差(MAE)が5.2であったのに対し、ユーザータグのみのモデルでは6.2であった。これは、より高い予測精度を示している。
  • ユーザーが提供したタグ『#fatgirlstatus』は、運動不足と強く相関しており、自己言及的な言語がライフスタイル行動を反映している可能性を示唆している。
  • ユーザーが自らを特定しない可能性の高い差別的行動(例:物質使用)において、機械生成タグは、ユーザーが明示的にラベル付けしないにもかかわらず、暗黙の視覚的手がかりを捉えることで特に有効であった。
  • 特徴量分析から、『会議』や『パーティー』といったタグが過剰飲酒と強く相関していることが判明し、自動タグ付けが社会的文脈を捉えていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。