Skip to main content
QUICK REVIEW

[論文レビュー] The Secret Lives of Names? Name Embeddings from Social Media

Junting Ye, Steven Skiena|arXiv (Cornell University)|May 12, 2019
Epigenetics and DNA Methylation参考文献 33被引用数 10
ひとこと要約

本稿では、Twitterデータ上で訓練された公開可能な名前埋め込み表現を提案し、性別、人種、国籍分類においてプライベートなメールベースの埋め込み表現と同等またはそれを上回る性能を示した。主な貢献は、Twitter名前埋め込み(www.name-prism.com)の公開および、従来の人口統計的特徴では捉えきれない潜在的な社会経済的・人種的グループ差を反映していることの証明である。

ABSTRACT

Your name tells a lot about you: your gender, ethnicity and so on. It has been shown that name embeddings are more effective in representing names than traditional substring features. However, our previous name embedding model is trained on private email data and are not publicly accessible. In this paper, we explore learning name embeddings from public Twitter data. We argue that Twitter embeddings have two key advantages: extit{(i)} they can and will be publicly released to support research community. extit{(ii)} even with a smaller training corpus, Twitter embeddings achieve similar performances on multiple tasks comparing to email embeddings. As a test case to show the power of name embeddings, we investigate the modeling of lifespans. We find it interesting that adding name embeddings can further improve the performances of models using demographic features, which are traditionally used for lifespan modeling. Through residual analysis, we observe that fine-grained groups (potentially reflecting socioeconomic status) are the latent contributing factors encoded in name embeddings. These were previously hidden to demographic models, and may help to enhance the predictive power of a wide class of research studies.

研究の動機と目的

  • プライベートなメールベースの埋め込み表現の限界を克服するため、Twitterデータを用いた公開可能な名前埋め込みの開発。
  • Twitter名前埋め込みが、人口統計的分類タスクにおいてメールベースの埋め込み表現と同等またはそれを上回る性能を示すかどうかの評価。
  • 名前埋め込みが、従来の人口統計的変数を上回る予測力を持つことの実証。
  • 残差分析を通じて、名前埋め込みに埋め込まれた潜在的な社会経済的・人種的グループ差の特定。

提案手法

  • 公開のTwitterデータを用いた教師なし手法による名前埋め込みの訓練。コミュニケーションパターンを活用し、文化的・社会的同質性を捉える。
  • Twitterの相互作用から複数の埋め込みバージョンを構築:メンション、フォロワー、フォローイー、および集約済み埋め込み。これにより、さまざまなソーシャルネットワーク信号を探索。
  • 出生年、州、性別、人種、国籍などの人口統計的特徴と名前埋め込みを用いて、線形回帰モデルで寿命を予測。
  • 寿命予測モデルの残差分析を実施し、名前埋め込みに起因する説明されない分散を同定。
  • 155組の短縮形/フォーマル名のペアおよび20の頻出姓を分析し、フォーマル名や特定の民族的姓に有利なバイアスの有無を検出。
  • 統計的仮説検定(p < 0.01)を適用し、名前の形式および姓の好ましさに関する観察されたバイアスの妥当性を検証。

実験結果

リサーチクエスチョン

  • RQ1Twitter由来の名前埋め込みは、人口統計的分類タスクにおいて、プライベートなメールベースの埋め込み表現と同等の性能を達成できるか?
  • RQ2名前埋め込みは、従来の人口統計的特徴を上回る寿命予測モデルの精度を向上させるか?
  • RQ3標準的人口統計的変数では捉えきれない、名前埋め込みに埋め込まれた潜在的な社会経済的または人種的グループ差は何か?
  • RQ4フォーマル名よりも短縮形名に寿命の向上が系統的に有利に働くバイアスは存在するか?また、これは社会経済的地位と相関するか?
  • RQ5名前埋め込みは、アシュケナージ・ユダヤ人、スカンジナビア系など、より細分化されたグループのアイデンティティを捉え、それらが長寿と相関するか?

主な発見

  • Twitter名前埋め込みは、訓練コーパスが小さいにもかかわらず、性別、人種、国籍分類においてメールベースの埋め込みと同等の性能を示した。
  • メンション埋め込みは、性別認識においてメール埋め込みを上回った。これは、Twitterのメンションにおいて性別同質性が強いことを示唆している。
  • 集約済みTwitter埋め込みが全体的に最も優れた性能を示し、www.name-prism.com で公開された。
  • 名前埋め込みを組み込むことで、32の全テスト設定において寿命予測モデルの性能が向上し、p値 < 0.01 であった。これは統計的に有意であることを示している。
  • 残差分析から、名前埋め込みが、標準的人口統計的特徴では捉えきれない、細分化された社会経済的差(例:フォーマル名の好ましさ、アシュケナージ・ユダヤ人の姓の好ましさ)をエンコードしていることが明らかになった。
  • 統計的検定により、フォーマル名の好ましさに顕著なバイアスが確認された(p < 0.01)。155組の名前ペアのうち74%が、メール埋め込みにおいてフォーマル形の寿命向上が顕著であった。また、Twitter埋め込みでは60%のペアで同様の傾向が観察された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。