[論文レビュー] Inferring gender of a Twitter user using celebrities it follows
本稿では、LIWCを用いたユーザーのつぶやきからの言語的特徴と、有名人のフォローパatters(特にフォローする有名人の性別、年齢、職業)を組み合わせることで、Twitterユーザーの性別分類モデルを提案する。最高の性能は、言語的特徴と有名人周辺性特徴を融合させた場合に達成され、85.67%の正確度を示した。これは、ソーシャルネットワークの文脈がTwitter上での性別推定に顕著に寄与することを示している。
This paper addresses the task of user gender classification in social media, with an application to Twitter. The approach automatically predicts gender by leveraging observable information such as the tweet behavior, linguistic content of the user's Twitter feed and the celebrities followed by the user. This paper first evaluates linguistic content based features using LIWC dictionary and popular neighborhood features using Wikipedia and Freebase. Then augments both features which yielded a significant increase in the accuracy for gender prediction. Results show that rich linguistic features combined with popular neighborhood prove valuables and promising for additional user classification needs.
研究の動機と目的
- 観察可能で侵襲的でない特徴を用いて、Twitterユーザーの性別分類の正確度を向上させること。
- ユーザーがフォローする有名人の性別、年齢、職業が、ユーザー自身の性別を効果的に予測する要因となるかどうかを調査すること。
- LIWCを用いた言語的特徴と、ソーシャルネighborhood特徴(有名人プロフィール)を個別および組み合わせた状況で、それぞれの貢献度を評価すること。
- ソーシャルメディアのプロファイリングにおいて、ユーザーが自己申告する属性やアノテートされた属性の代替として、有名人ベースの特徴がスケーラブルに利用可能である可能性を検討すること。
提案手法
- 各ユーザーの最後の1000件のつぶやきから、性別に関連する言語的使用と関連する語彙カテゴリを抽出するためにLIWC辞書を活用した。
- 米国社会保障局の2011年版上位100件の名前を用いて、性別が確認済みの265名のTwitterユーザーのデータセットを収集・処理した。
- 10,000人以上のフォロワーがいるか、公式認証を受けたユーザーとして有名人を特定し、265人のユーザーがフォローした5,546件の有名人アカウントを特定した。
- WikipediaおよびFreebaseから有名人特徴を抽出した。その内容には、性別(代名詞頻度を用いて)、年齢、および「何で有名か」のカテゴリ(例:音楽、政治、スポーツ)が含まれた。
- ツイートテキストのクリーニングに、メタフォンとTextBrewの文字列編集距離を組み合わせたハイブリッド手法に加え、独自のTwitterスラング辞書を用いた綴り訂正を実施した。
- 10分割交差検証を用いてSVM分類器を訓練し、言語的特徴のみ、ネイバーフッド特徴のみ、および両方を組み合わせた設定の下で性能を評価した。
実験結果
リサーチクエスチョン
- RQ1ユーザーのつぶやきから抽出した言語的特徴は、Twitter上での性別分類の正確度を向上させることができるか?
- RQ2ユーザーがフォローする有名人の性別、年齢、職業が、ユーザー自身の性別をどの程度正確に予測できるか?
- RQ3言語的特徴と有名人ネイバーフッド特徴を組み合わせることで、単独で使用する場合よりも高い性能が得られるか?
- RQ4有名人特徴の種類(例:性別対職業)は、性別予測にどの程度貢献するか?
主な発見
- LIWCを用いた言語的特徴とつぶやき行動の組み合わせにより、性別分類の正確度が82.26%まで向上した。
- フォローする有名人の性別のみを用いた場合でも71.57%の正確度を達成し、性別推定において強力な信号であることが示された。
- 有名人の「何で有名か」のカテゴリ(例:音楽、政治、スポーツ)は67.23%の正確度を示し、関心に基づくパターンが情報的であることが示唆された。
- 有名人の年齢は最も低い正確度56.05%を示し、性別分類において予測力が限定的であることが示された。
- 最高の全体的な性能は、すべての特徴を組み合わせた場合に達成され、正確度85.67%、適合率84.56%、再現率86.82%というバランスの取れた性能を示した。
- 結果から、特に有名人の性別といったソーシャルネighborhood特徴が、ユーザー属性推定において非常に価値があり、かつ現在のところあまり活用されていない可能性が示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。