Skip to main content
QUICK REVIEW

[論文レビュー] What are the biases in my word embedding?

Nathaniel Swinger, Maria De‐Arteaga|arXiv (Cornell University)|Dec 20, 2018
Hate Speech and Cyberbullying Detection参考文献 22被引用数 17
ひとこと要約

本論文では、名前と一般的な語の間の幾何的パターン(平行性およびクラスタ構造)を特定することで、語の埋め込みにおけるバイアスを自動的に検出・列挙する非教師ありアルゴリズムを提案する。この手法により、人種、性別、宗教、年齢に関連する広範な攻撃的関連性が判明し、たとえデバイアス化されたとされる埋め込みであっても依然として存在していることが示された。名前の削除だけでは代理バイアスを完全に排除できないことが明らかになった。

ABSTRACT

This paper presents an algorithm for enumerating biases in word embeddings. The algorithm exposes a large number of offensive associations related to sensitive features such as race and gender on publicly available embeddings, including a supposedly "debiased" embedding. These biases are concerning in light of the widespread use of word embeddings. The associations are identified by geometric patterns in word embeddings that run parallel between people's names and common lower-case tokens. The algorithm is highly unsupervised: it does not even require the sensitive features to be pre-specified. This is desirable because: (a) many forms of discrimination--such as racial discrimination--are linked to social constructs that may vary depending on the context, rather than to categories with fixed definitions; and (b) it makes it easier to identify biases against intersectional groups, which depend on combinations of sensitive features. The inputs to our algorithm are a list of target tokens, e.g. names, and a word embedding. It outputs a number of Word Embedding Association Tests (WEATs) that capture various biases present in the data. We illustrate the utility of our approach on publicly available word embeddings and lists of names, and evaluate its output using crowdsourcing. We also show how removing names may not remove potential proxy bias.

研究の動機と目的

  • 事前にラベル付けされた感受性のある属性を必要とせずに、語の埋め込みにおけるバイアスを検出する非教師あり手法の開発。
  • 特に弱い立場にあるグループに対して有害でステレオタイプ的な関連性が、デバイアス化されたとされる埋め込みでさえも依然として残っていることを暴露する。
  • 訓練データから名前を削除しても、意味的関連性が依然として差別を内包する可能性があるため、代理バイアスが消えないことを示す。
  • 研究者やエンジニアが展開前に埋め込みの公平性を監査できる、スケーラブルで自動化されたツールの提供。

提案手法

  • 平行性を利用:名前のペア(例:Mary–John)のベクトル差が、属性語のペア(例:Queen–King)のベクトル差とほぼ平行であることを特徴とし、バイアスを示す。
  • クラスタ性を導入:名前および語の正規化されたベクトルが、性別、宗教、その他の社会的構造に基づいて意味的に整合性のあるクラスタを形成することを特徴とする。
  • これらの幾何的パターンを用いて、事前に感受性のある特徴を指定せずに、統計的に有意な語の埋め込み関連性テスト(WEAT)を生成する。
  • 検出された関連性の統計的信頼性を保証するため、誤り発見率の上限を適用する。
  • 検出されたバイアスが人間が認識するステレオタイプと一致することを検証するために、クラウドソーシングを用いる。
  • 有意な関連性の4要素組み合わせを分析することで、間接的バイアスの可能性を特定する。

実験結果

リサーチクエスチョン

  • RQ1事前に感受性のある属性を指定せずに、語の埋め込みにおける広範なバイアスを自動検出可能か?
  • RQ2広く使われている語の埋め込み(特にデバイアス化されたもの)は、どれほど攻撃的またはステレオタイプ的な関連性を内包しているか?
  • RQ3提案手法は、人間が認識する社会的ステレオタイプと一致するバイアスをどれほど効果的に特定できるか?
  • RQ4名前を訓練データから削除した後も、代理バイアスが残存するか?また、埋め込み内の幾何的パターンから検出可能か?
  • RQ5事前に明示的に定義されていない交差的・マイノリティグループに対するバイアスを、アルゴリズムが解明できるか?

主な発見

  • 公開済みの語の埋め込み(特にデバイアス化されたとされるものも含む)において、人種、性別、宗教、年齢に関連する多数の攻撃的関連性が検出された。
  • Word2Vec埋め込みでは99%、fastTextでは98%、GloVeでは97%の有意な4要素組み合わせが、間接的バイアスの可能性を示しており、名前の削除後も代理関連性が残存していることが示された。
  • クラウドソーシングの結果、『n*****』『jihad』『s******』『hottie』といった最も攻撃的な関連性は、特定の名前のクラスタと結びつけられた際、平均評価が6.0以上と高く、一貫して攻撃的であると評価された。
  • アルゴリズムは、性別、宗教、民族に相当するクラスタを効果的に特定した。特に、名前として姓を使用した場合、明確なアジア系アメリカ人の姓クラスタが検出された。
  • Bolukbasiら(2016)が開発したデバイアス化埋め込みに対しても、強い統計的有意なバイアスが検出された。これは、デバイアス化手法が完全にバイアスを排除していない可能性を示唆している。
  • 12分類分類タスクにおいて50%以上の正答率を達成した。これは、アルゴリズムが特定する名前とグループの関連性が、人間のレーティング者にとって解釈可能で意味のあるものであることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。