Skip to main content
QUICK REVIEW

[論文レビュー] Onomastics 2.0 - The Power of Social Co-Occurrences

Folke Mitzlaff, Gerd Stumme|arXiv (Cornell University)|Mar 3, 2013
Names, Identity, and Discrimination Research参考文献 1被引用数 4
ひとこと要約

本稿では、ウィキペディアおよびTwitterからのソーシャルウェブ共起ネットワークを活用して、与えられた名前や都市名の間の意味的関係を、ネットワークベースの類似性メトリクスを用いて発見するデータマイニング手法を提案する。共起グラフにおける構造的類似性と意味的関連性の間に強く相関する関係が示され、特にウィキペディアデータにおいて顕著である。これにより、4か月間で30,000人以上のユーザーを獲得した成功した名前検索プラットフォーム「Nameling」の開発がなされた。

ABSTRACT

Onomastics is "the science or study of the origin and forms of proper names of persons or places." ["Onomastics". Merriam-Webster.com, 2013. http://www.merriam-webster.com (11 February 2013)]. Especially personal names play an important role in daily life, as all over the world future parents are facing the task of finding a suitable given name for their child. This choice is influenced by different factors, such as the social context, language, cultural background and, in particular, personal taste. With the rise of the Social Web and its applications, users more and more interact digitally and participate in the creation of heterogeneous, distributed, collaborative data collections. These sources of data also reflect current and new naming trends as well as new emerging interrelations among names. The present work shows, how basic approaches from the field of social network analysis and information retrieval can be applied for discovering relations among names, thus extending Onomastics by data mining techniques. The considered approach starts with building co-occurrence graphs relative to data from the Social Web, respectively for given names and city names. As a main result, correlations between semantically grounded similarities among names (e.g., geographical distance for city names) and structural graph based similarities are observed. The discovered relations among given names are the foundation of "nameling" [http://nameling.net], a search engine and academic research platform for given names which attracted more than 30,000 users within four months, underpinningthe relevance of the proposed methodology.

研究の動機と目的

  • ソーシャルウェブデータを用いて、与えられた名前同士の新たな関係を発見するための手法を開発すること。
  • ネットワークベースの類似性メトリクスが、固有名称同士の意味的関連性をどれほど的確に捉えられるかを評価すること。
  • 異なる言語版ウィキペディアから得られる共起ネットワークの構造的および意味的特性を比較すること。
  • ソーシャルネットワーク分析および情報検索技術に裏打ちされた実用的な名前推薦システムを構築すること。
  • 共起ネットワークが、言語的・文化的由来に基づく固有名称の分類にどの程度有用であるかを検討すること。

提案手法

  • ノードが与えられた名前または都市名を表し、エッジがテキスト内での共起を表す共起グラフを、ウィキペディアおよびTwitterデータから構築する。
  • 共有近傍ノードに基づいた標準的な類似度関数(コサイン類似度およびジャカード係数)を適用し、ノード間の構造的類似度を測定する。
  • 観察された類似度トレンドを無作為モデルのグラフと比較し、統計的アーティファクトを除外し、有意性を評価する。
  • ネットワークの近接性の代理指標として最短経路距離を用い、意味的関連性(都市名の場合は地理的距離、名前の場合は意味的類似度)と相関をとらえる。
  • 外部の意味的測定基準(地理的距離や既知の名前バリエーションなど)と比較することで、類似度メトリクスの性能を評価する。
  • 実世界の使用データを収集するため、発見された関係に基づいて構築された「Nameling」プラットフォームを活用し、レコメンデーション文脈における類似度関数の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1ウィキペディアおよびTwitterから導出された共起グラフにおける構造的類似性は、与えられた名前同士の意味的関連性をどの程度反映しているか?
  • RQ2共有近傍に基づく類似度メトリクスは、都市名の意味的関連性(例:地理的近接性)とどの程度相関するか?
  • RQ3ウィキペディアとTwitterの共起ネットワークは、それぞれどのような意味的特徴を捉えているか?
  • RQ4ウィキペディアの共起ネットワークに見られる言語特異的特徴は、名前の言語的・文化的由来を分類するために利用可能か?
  • RQ5実世界の名前推薦シナリオにおいて、基本的なネットワーク類似度関数はどの程度有効か?

主な発見

  • ウィキペディアベースの共起ネットワークでは、最短経路距離が増加するにつれて平均類似度(コサイン類似度およびジャカード係数)が強く単調に減少する傾向が認められ、隣接する名前同士が意味的により類似していることを示している。
  • ウィキペディアネットワークにおける直接の隣接ノードペアは、ランダムなノードペアよりも顕著に類似度が高く、距離が2のノードペアは予想される類似度よりも低く、構造的類似度が意味的関連性を的確に捉えていることを裏付けている。
  • 都市名に関しては、ウィキペディアネットワークにおいて最短経路距離と地理的距離の間に正の相関が認められ、ほとんどの距離において統計的に有意であることが示された。
  • 一方、Twitterベースのネットワークでは、都市名に関して最短経路距離と地理的距離の間に逆相関関係が認められ、Twitterにおける共起の意味的解釈はウィキペディアとは根本的に異なることが示された。
  • 発見された名前の関係に基づいて構築された「Nameling」プラットフォームは、4か月間で30,000人以上のユーザーを獲得し、本手法の実用的意義を実証した。
  • 固有ベクトル中心性分析により、多言語ウィキペディア共起ネットワークに言語特異的特徴が明確に現れることが判明し、言語に配慮したエンティティ分類への応用可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。