[論文レビュー] Man is to Person as Woman is to Location: Measuring Gender Bias in Named Entity Recognition
本稿では、名前エンティティ認識(NER)システムにおける性別バイアスを測定するベンチマークを導入し、女性の名前が男性の名前と比較して非PERSONエンティティ(例:場所や都市)として誤分類される頻度を評価する。139年分の米国人口センサスの赤ちゃんの名前データを9つのテンプレート文脈で使用し、最先端のNERモデルが女性の名前を体系的に低く認識していることが判明。特に重み付き頻度指標では、女性の名前の誤り率が最大2.5倍にのぼり、NLPシステムにおける顕著な公平性の欠如が浮き彫りになった。
We study the bias in several state-of-the-art named entity recognition (NER) models---specifically, a difference in the ability to recognize male and female names as PERSON entity types. We evaluate NER models on a dataset containing 139 years of U.S. census baby names and find that relatively more female names, as opposed to male names, are not recognized as PERSON entities. We study the extent of this bias in several NER systems that are used prominently in industry and academia. In addition, we also report a bias in the datasets on which these models were trained. The result of this analysis yields a new benchmark for gender bias evaluation in named entity recognition systems. The data and code for the application of this benchmark will be publicly available for researchers to use.
研究の動機と目的
- 名前エンティティ認識(NER)モデルが、男性の名前と比較して女性の名前をPERSONエンティティとして認識する際に性別バイアスを示すかどうかを調査すること。
- 139年分の米国人口センサスの赤ちゃんの名前データを用いて、NERシステムにおける性別バイアスを評価可能な公開ベンチマークを開発すること。
- モデルのアップデートやトレーニングデータの分布が、NERパフォーマンスにおける性別バイアスにどのように寄与するか、またはそれを拡大するかを分析すること。
- 広く使われているNERモデルおよびデータセットにおける女性の名前の不顕在化と誤分類の程度を定量化すること。
提案手法
- 米国人口センサスの赤ちゃんの名前を、PERSONエンティティとして分類されるべき9つの文のテンプレートに埋め込んだベンチマークデータセットを構築した。
- Flair、CoreNLP 3.9、spaCy(小、中、大)の5つの最先端NERモデルを、139年分のデータ(1880–2018)に対してベンチマークで評価した。
- 誤り率の3種類を計算した:重みなし、名前の頻度で重み付けした、文脈別。これにより、異なる条件下でのバイアスを評価した。
- 公平性指標として統計的同等性を用い、女性の名前と男性の名前の誤り率を比較することで、誤分類の不均衡としてバイアスを定義した。
- CoNLL 2003 や OntoNotes5 のトレーニングデータセットを分析し、トレーニングデータに女性の名前が不顕在化していることがモデルバイアスに寄与しているかどうかを評価した。
- CoreNLPのバージョン間比較分析を実施し、モデルのアップデートが既存の性別バイアスを悪化させたかどうかを検証した。
実験結果
リサーチクエスチョン
- RQ1最先端のNERモデルは、女性の名前を男性の名前よりも体系的に非PERSONエンティティとして誤分類するのか?
- RQ2トレーニングデータにおける名前の頻度が、NERモデルにおける誤分類率にどの程度影響を与えるのか?
- RQ3モデルのアップデート(例:CoreNLP 3.8 から 3.9)は、NERシステムにおける性別バイアスにどのように影響するのか?
- RQ4広く使われているNERトレーニングデータセットは、実世界における男性と女性の名前の分布をどの程度反映しているのか?
- RQ5異なるモデルや応用分野でNERシステムにおける性別バイアスを評価できる標準化されたベンチマークを設計できるか?
主な発見
- 名前の頻度で重み付けした場合、女性の名前の誤分類率は男性の名前と比較して最大2.5倍にのぼり、顕著な性別バイアスが示された。
- すべてのテンプレートで女性の名前の誤り率が一貫して高く、特に「Xは人物である」といった文脈的に明確なケース(テンプレート4)でも、誤分類が継続していた。
- CoreNLP 3.8 から 3.9 へのアップデートにより、性別バイアスが悪化した。以前は正しくタグ付けされていた名前(例:Charlotte や Jordan)が、場所や都市として誤分類された。
- CoNLL 2003 や OntoNotes5 のトレーニングデータセットでは、女性の名前が不顕在化されており、テストセットにおける女性の名前は42–44%にとどまるが、米国人口センサスデータでは62%が女性の名前であった。
- ベンチマークにより、spaCy や Flair といった高精度なモデルですら顕著な性別バイアスを示しており、特に重み付き誤り率指標で顕著であった。これは、モデル設計およびデータ表現に根本的な問題があることを示唆している。
- 本研究では、NERにおける性別バイアスがモデルにのみ存在するのではなく、トレーニングデータに根ざしていることが明らかになった。これにより、バイアス低減にはデータキュレーションとモデル評価の両方を同時に取り組む必要があることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。