[論文レビュー] Inferring Fine-grained Details on User Activities and Home Location from Social Media: Detecting Drinking-While-Tweeting Patterns in Communities
本論文は、ニューヨーク市およびモンロー郡の地理タグ付きツイートを用いて、ツイッターのデータ内における即時の飲酒報告と過去/未来の言及、一般論議を区別する機械学習フレームワークを提案する。同時に、ブロック単位(100m解像度)の精度でユーザーの自宅位置を正確に推定する。階層的SVM分類器を用いて、地域の飲酒店の密度とコミュニティレベルの飲酒自己報告の間に顕著な正の相関が確認され、特に準都市部で相関が強いことが明らかになった。
Nearly all previous work on geo-locating latent states and activities from social media confounds general discussions about activities, self-reports of users participating in those activities at times in the past or future, and self-reports made at the immediate time and place the activity occurs. Activities, such as alcohol consumption, may occur at different places and types of places, and it is important not only to detect the local regions where these activities occur, but also to analyze the degree of participation in them by local residents. In this paper, we develop new machine learning based methods for fine-grained localization of activities and home locations from Twitter data. We apply these methods to discover and compare alcohol consumption patterns in a large urban area, New York City, and a more suburban and rural area, Monroe County. We find positive correlations between the rate of alcohol consumption reported among a community's Twitter users and the density of alcohol outlets, demonstrating that the degree of correlation varies significantly between urban and suburban areas. While our experiments are focused on alcohol use, our methods for locating homes and distinguishing temporally-specific self-reports are applicable to a broad range of behaviors and latent states.
研究の動機と目的
- ソーシャルメディアにおける即時の飲酒報告と過去/未来の言及、一般論議を区別すること。
- スパarsely、ノイジーな地理タグ付きツイッターデータから、ブロック単位(100m解像度)でユーザーの自宅位置を正確に推定すること。
- 即時の報告を自宅位置と地域の飲酒店の密度にリンクさせることで、コミュニティレベルの飲酒行動パターンを分析すること。
- 都市部(ニューヨーク市)と準都市部(モンロー郡)のコミュニティ間における飲酒行動パターンの違いを比較すること。
- 従来のアンケートの制限を克服し、ソーシャルメディアデータを用いて細分化された公衆衛生分析を可能にすること。
提案手法
- 即時の飲酒報告、過去/未来の自己報告、一般論議の3つに分類するため、3段階のサポートベクターマシン(SVM)の階層を訓練した。
- 時間的明確性と自己言及に基づいて、人間によるアノテーションを用いたトレーニングデータを活用し、各SVM分類器のFスコアが83%を超えた。
- 1人のユーザーあたり最低5件の地理タグ付きツイートで学習したSVMを用いて、ブロック単位の自宅位置推定モデルを開発。100mグリッド内での予測精度は70%を達成した。
- ニューヨーク市およびモンロー郡の地理タグ付きツイッターデータにモデルを適用し、都市部と準都市部の飲酒行動パターンを比較した。
- 即時の飲酒報告ツイートを自宅位置にマッピングし、自宅からの移動距離を計算することで、自宅からの距離に応じた飲酒場所を特定した。
- 空間分析を用いて、コミュニティレベルの飲酒率と地域の飲酒店の密度を相関させ、環境的要因の影響を評価した。
実験結果
リサーチクエスチョン
- RQ1ソーシャルメディアにおいて、即時の飲酒報告と過去/未来の自己報告、一般論議をどのように区別できるか?
- RQ2スパarselyな地理タグ付きツイッターデータから、ブロック単位の解像度でユーザーの自宅位置をどの程度正確に推定できるか?
- RQ3ソーシャルメディアに反映された都市部と準都市部のコミュニティにおける飲酒行動パターンの違いは何か?
- RQ4飲酒店の密度とコミュニティレベルの自己報告飲酒行動の間に、どの程度の相関があるか?
- RQ5自宅位置と即時の飲酒ツイートを関連付けることで、移動行動と飲酒環境に関するどのような知見が得られるか?
主な発見
- 階層的SVM分類器は、即時の飲酒報告と過去/未来の言及、一般論議を区別する際、Fスコア83%以上を達成した。
- 自宅位置推定モデルは、100mグリッド内での予測精度が70%に達し、ニューヨーク市の活動ユーザーの71%が5件の地理タグ付きツイートでカバーされた。
- 即時の飲酒自己報告の頻度と地域の飲酒店の密度との間に顕著な正の相関が確認され、特に準都市部で相関が強いことが分かった。
- モンロー郡(主に準都市部)では、飲酒店の密度と飲酒自己報告の相関がニューヨーク市よりも顕著に高く、環境的要因の影響が都市部よりも強い可能性を示唆した。
- 平均して、即時の飲酒報告を含むツイートは、自宅から1,000メートル以上離れた場所から発信されており、飲酒がしばしば自宅外で行われていることを示している。
- 本研究は、ソーシャルメディアデータが、スケーラブルな公衆衛生監視を可能にする細分化された即時の健康行動の洞察を提供できることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。