Skip to main content
QUICK REVIEW

[論文レビュー] Gender Prediction in Social Media

James Smith|arXiv (Cornell University)|Jul 8, 2014
Authorship Attribution and Profiling参考文献 10被引用数 6
ひとこと要約

本稿では、Fotologのスクリーンネームとフォロワー数のみを用いて、性別予測のためのヒューリスティック手法を提案する。スクリーンネームに女性に関連する名前や語句を検索することで、64.70%の正解率を達成した。この手法は限られたユーザー情報からの言語的および社会的手がかりを活用し、スクリーンネームにおける性別特異的命名パターンが、最小限の入力でも意味のある予測を可能にすることを示している。

ABSTRACT

In this paper, we explore the task of gender classification using limited network data with an application to Fotolog. We take a heuristic approach to automating gender inference based on username, followers and network structure. We test our approach on a subset of 100,000 nodes and analyze our results to find that there is a lot of value in these limited information and that there is great promise in further pursuing this approach to classification.

研究の動機と目的

  • スクリーンネームやフォロワー数といった最小限のソーシャルメディアデータのみを用いて、一般化可能な性別予測手法を開発すること。
  • 本名が利用できない状況において、スクリーンネームにおける性別特異的命名パターンが実際の性別と相関しているかどうかを評価すること。
  • 複雑な機械学習や大規模なトレーニングデータに依存しないヒューリスティック手法を検討すること。
  • 限られた公開可能なネットワーク特徴量のみを用いて、Fotologにおける性別予測の可能性を評価すること。
  • 完全なユーザープロフィールを必要とせずに、予測精度を向上させるために有効な言語的および社会的手がかりを特定すること。

提案手法

  • 著者らは、文化的なステレオタイプやスクリーンネームでの一般的な使用に基づき、女性に関連する名前や語句(例:'girl'、'love'、'Taylor')のリストを構築した。
  • 各ユーザーのスクリーンネームを、女性語句リストとの完全な部分文字列一致でスキャンし、一致した場合はユーザーを女性とラベル付けした。
  • 一致しなかったユーザーに対しては、Fotologユーザー集団における推定性別分布に基づき、70%の確率で女性、30%の確率で男性と確率的割り当てを実施した。
  • バリエーションのテストを通じて段階的な改善を図り、まず女性名のみを用いる方法を試し、その後一般的な性別語句を追加することで精度を向上させた。
  • アルゴリズムは、性別が判明している84,589人のFotologユーザーのサブセットを用いて評価された。性別ラベルが欠損している15,411人は除外された。
  • 最終的なモデルは、女性名の一致と追加の性別語句の組み合わせを採用し、テストされた設定の中で最高の正解率を達成した。

実験結果

リサーチクエスチョン

  • RQ1スクリーンネームとソーシャルメディアプラットフォームのフォロワー数のみを用いて、ある程度の精度で性別を予測できるか?
  • RQ2スクリーンネームにおける性別特異的名前や語句が、実際のユーザーの性別とどの程度相関しているか?
  • RQ3名前ベースのヒューリスティックに加え、'love' や 'girl' などの非名詞の性別語句を含めることで、予測精度はどの程度向上するか?
  • RQ4集団の推定分布に基づく確率的割り当ては、決定論的ルールと比較して性別予測においてどのように異なるか?
  • RQ5ユーザー行動や言語使用の差異がある異なるソーシャルメディアプラットフォームにおいても、このヒューリスティック手法は一般化可能か?

主な発見

  • ヒューリスティック手法は、スクリーンネームにおける女性名と性別語句の組み合わせを用いて、Fotologデータセットで最終的に64.70%の正解率を達成した。
  • スクリーンネームにおける女性名のみを用いた場合、63.95%の正解率を示し、女性名と女性と自己認識するユーザーとの強い相関が示された。
  • 一般的な性別語句(例:'girl' や 'love')を追加することで、正解率は63.95%から64.70%に向上した。
  • 50/50のランダム割り当てベースラインでは正解率が60%に低下し、ヒューリスティック手法が単純な推測を上回ることを確認した。
  • トレンドトピックの検索にのみ依存した場合、正解率は約40%にとどまり、この文脈ではそのような語句の有用性が限定的であることが示された。
  • 男性名リストと女性名リストの両方を用いた部分文字列一致では、'Robert' に含まれる 'Bert' のような曖昧な部分文字列が正解率を低下させた可能性があるため、より洗練された部分文字列マッチングの必要性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。