Skip to main content
QUICK REVIEW

[論文レビュー] A World of Difference: Divergent Word Interpretations among People

Tianran Hu, Ruihua Song|arXiv (Cornell University)|Mar 8, 2017
Language and cultural evolution被引用数 6
ひとこと要約

本稿では、グループ固有の単語埋め込みと意味的距離メトリクスを用いて、社会的グループ間での語の解釈の相違を定量化する新しい手法を提案する。その結果、ニューヨーク市とシリコンバレー地域の住民では「react」や「code」といった語が異なる意味で解釈されており、テクノロジーと芸術分野における地域的文化的差異が反映されている。性別による解釈の相違は、異なる社会的態度や関心を示している。

ABSTRACT

Divergent word usages reflect differences among people. In this paper, we present a novel angle for studying word usage divergence -- word interpretations. We propose an approach that quantifies semantic differences in interpretations among different groups of people. The effectiveness of our approach is validated by quantitative evaluations. Experiment results indicate that divergences in word interpretations exist. We further apply the approach to two well studied types of differences between people -- gender and region. The detected words with divergent interpretations reveal the unique features of specific groups of people. For gender, we discover that certain different interests, social attitudes, and characters between males and females are reflected in their divergent interpretations of many words. For region, we find that specific interpretations of certain words reveal the geographical and cultural features of different regions.

研究の動機と目的

  • 性別や地域といった社会的グループ間で語の解釈がどのように異なるかを調査すること。
  • 異なる人口統計的グループ間での語の意味的解釈の差を定量化する手法を開発すること。
  • 解釈の相違が特定の集団の文化的・地理的・社会的特徴をどのように反映しているかを解明すること。

提案手法

  • 性別(男性/女性)や都市(ニューヨーク市/シリコンバレー地域)といった異なる社会的グループのコーパスから、それぞれ別個の単語埋め込みモデルを学習し、グループ固有の単語ベクトル空間を生成する。
  • 各単語について、コサイン類似度を用いて各グループの埋め込み空間から意味的に最も近い語(解釈)を抽出する。
  • 平均二重コサイン類似度を用いて、各単語について異なるグループ間の解釈セット間の意味的距離を計算する。
  • 語の分散スコアを、異なるグループにおけるその語の解釈間の平均意味的距離として定義する。
  • 高い分散スコアを示す語を同定することで、顕著な解釈の相違を示す語を特定する。
  • 上位の相違が著しい語の手動による検証と、地域的・性別的パターンの定性的分析を通じて、結果の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1男性と女性の間で語の解釈はどのように異なるのか。このような差はどのような社会的・心理的特徴を反映しているのか。
  • RQ2ニューヨーク市やシリコンバレーといった都市間で言語使用に見られる地理的・文化的差異は、どの程度顕著なのか。
  • RQ3どの語が異なる人口統計的グループ間で最も高い解釈の分散を示し、それらの語はグループ固有の関心やアイデンティティをどのように反映しているのか。

主な発見

  • 『react』という語は、シリコンバレー地域ではソフトウェアの動作として解釈される(最も近い語:『webpack』、『filesystem』)が、ニューヨーク市では「応答する」という意味で解釈される(最も近い語:『respond』、『confuse』)。
  • 『code』という語は、シリコンバレー地域ではプログラミングに関連して解釈される(最も近い語:『compiler』、『regex』)が、ニューヨーク市では割引クーポンに関連して解釈される(最も近い語:『coupon』、『discount』)。
  • 『berkeley』といった地名は、ニューヨーク市では大学として解釈されるが、シリコンバレー地域では都市として解釈され、地理的解釈の差を示している。
  • 『bart』という語は、シリコンバレー地域では交通機関として解釈される(最も近い語:『muni』、『train』)が、ニューヨーク市ではアニメキャラクターとして解釈される(最も近い語:『homer』、『marge』)。
  • ファッションや音楽関連の語、たとえば『model』や『metal』は強い地域的バイアスを示す:『model』はニューヨーク市ではファッションを指す(最も近い語:『supermodel』、『stylist』)が、シリコンバレー地域では数学的モデルを指す。
  • 『port』という語の解釈の違いから、文化的差が顕著に現れる:ニューヨーク市では港として解釈される(最も近い語:『ferry』、『dock』)が、シリコンバレー地域ではハードウェアのポートとして解釈される(最も近い語:『ethernet』、『connector』)。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。