Skip to main content
QUICK REVIEW

[論文レビュー] What's my age?: Predicting Twitter User's Age using Influential Friend Network and DBpedia

Alan Smith, Manas Gaur|arXiv (Cornell University)|Apr 10, 2018
Authorship Attribution and Profiling参考文献 12被引用数 4
ひとこと要約

本論文は、影響力のある友人ネットワークとDBpediaの構造化知識を用いて、Twitterユーザーの年齢を予測する機械学習的手法を提案する。ユーザー固有のDBpediaカテゴリと正規化されたフォロワー影響力特徴を活用することで、6.8のMAEと10年以内の誤差範囲内での83.7%の精度を達成し、平均予測ベースラインを上回る性能を示した。

ABSTRACT

Social media is a rich source of user behavior and opinions. Twitter senses nearly 500 million tweets per day from 328 million users.An appropriate machine learning pipeline over this information enables up-to-date and cost-effective data collection for a wide variety of domains such as; social science, public health, the wisdom of the crowd, etc. In many of the domains, users demographic information is key to the identification of segments of the populations being studied. For instance, Which age groups are observed to abuse which drugs?, Which ethnicities are most affected by depression per location?. Twitter in its current state does not require users to provide any demographic information. We propose to create a machine learning system coupled with the DBpedia graph that predicts the most probable age of the Twitter user. In our process to build an age prediction model using social media text and user meta-data, we explore the existing state of the art approaches. Detailing our data collection, feature engineering cycle, model selection and evaluation pipeline, we will exhibit the efficacy of our approach by comparing with the "predict mean" age estimator baseline.

研究の動機と目的

  • Twitterのプロファイルにデモグラフィックデータが不足している問題に対処するため、手動のアンケートやインタビューに依存せずにユーザーの年齢を予測すること。
  • 社会的ネットワーク構造(影響力のある友人)とDBpediaからの意味的知識を統合することで、年齢予測の精度を向上させること。
  • リアルタイムのソーシャルメディアデータを対象とした、スケーラブルで自動化された年齢推定パイプラインの開発。
  • ユーザーの関心、DBpediaカテゴリ、ネットワーク影響力指標を組み合わせた特徴工学の有効性を評価すること。
  • 知識強化特徴が、平均年齢推定などのベースラインモデルと比較して予測誤差を低減することを実証すること。

提案手法

  • 各ターゲットユーザーの影響力のある友人(フォロワー数が顕著に高いユーザー)を特定するため、深さ優先探索を用いて1ホップ分の探索を実施する。
  • 各影響力のある友人に関連付けられたDBpediaカテゴリを抽出し、ユーザーの関心や社会的文脈を表現する。
  • 各ユーザーのカテゴリ数をそのユーザーの影響力のある友人の総数で割ることで、正規化された割合ベースの特徴量を生成する。
  • 相互作用に基づく特徴量にスケーリングを適用し、ユーザー固有のフォロワー数によるバイアスを低減し、モデルの一般化性能を向上させる。
  • 23,120人のユーザーからなるデータセットを用いて、交差検証を実施し、SVR-RBF、LASSO、線形カーネルSVRなどの複数の回帰モデルを訓練および評価する。
  • 予測バイアスの評価に残差解析を用い、MAE、MedAE、R²、Accuracy@10などの統計的指標を用いてモデルの性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1影響力のある友人ネットワークとDBpediaカテゴリを用いることで、単純な平均年齢ベースラインに比べ、機械学習モデルがTwitterユーザーの年齢をより正確に予測できるか?
  • RQ2相対的影響力と関心分布に基づく特徴量スケーリングは、年齢予測におけるモデル性能にどのように影響するか?
  • RQ3DBpediaからの意味的知識を統合することで、年齢推定における予測誤差はどの程度低減されるか?
  • RQ4若年層、思春期、高年齢層など、異なる年齢層におけるモデルの性能(MAEおよび精度)にどのような差が生じるか?
  • RQ5モデルの予測バイアス(例:低予測)が全体の精度に与える影響はどの程度か、またこれは残差プロットにどのように反映されるか?

主な発見

  • SVR-RBFモデルは、最小の平均絶対誤差(MAE)6.8を達成し、ベースラインの平均予測モデル(MAE = 8.1)を顕著に上回った。
  • ±10年以内の誤差範囲内で83.7%の精度を達成し、83.7%のユーザーが20年間の範囲内で正しい年齢を予測できたことを示した。
  • 誤差範囲を広げると精度が向上し、±10年で83.7%、±9年で79.6%に達し、中程度の予測誤差に対しても頑健であることが示された。
  • 残差プロットから左に歪んだ分布が観察され、モデルは年齢を低めに予測する傾向にあるが、誤差が0に近い領域に密度が集中しており、中央付近の予測精度が非常に高いことが示された。
  • LASSOおよび線形SVRモデルは、正則化の強さに応じて性能に大きなばらつきを示したが、SVR-RBFモデルは安定しており、一貫して効果的であった。
  • SVR-RBFのR²スコアが低く(0.03)、データのスパarsityとノイズの影響が課題ではあるが、適切な特徴工学によりこれらは管理可能であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。