Skip to main content
QUICK REVIEW

[論文レビュー] Addressing Census data problems in race imputation via fully Bayesian Improved Surname Geocoding and name supplements

Kosuke Imai, Santiago Olivella|arXiv (Cornell University)|May 12, 2022
Data-Driven Disease Surveillance被引用数 8
ひとこと要約

本稿では、完全ベイズ的改善姓地理特定法(fBISG)と南部米国選挙人名簿からの名前補足データを用いて、人口統計データの2大問題を是正する手法を提案する。すなわち、マイノリティ集団のゼロカウント問題と、姓ファイルにおける姓の欠落問題である。この手法は、特にアジア系およびヒスパニック系の有権者において、レースの帰属推定の正確性を著しく向上させ、AUROCを最大15%向上させ、誤検出を18ポイント削減するが、同時に全レースグループにおいて良好なキャリブレーションを維持する。

ABSTRACT

Prediction of individual's race and ethnicity plays an important role in social science and public health research. Examples include studies of racial disparity in health and voting. Recently, Bayesian Improved Surname Geocoding (BISG), which uses Bayes' rule to combine information from Census surname files with the geocoding of an individual's residence, has emerged as a leading methodology for this prediction task. Unfortunately, BISG suffers from two Census data problems that contribute to unsatisfactory predictive performance for minorities. First, the decennial Census often contains zero counts for minority racial groups in the Census blocks where some members of those groups reside. Second, because the Census surname files only include frequent names, many surnames -- especially those of minorities -- are missing from the list. To address the zero counts problem, we introduce a fully Bayesian Improved Surname Geocoding (fBISG) methodology that accounts for potential measurement error in Census counts by extending the naive Bayesian inference of the BISG methodology to full posterior inference. To address the missing surname problem, we supplement the Census surname data with additional data on last, first, and middle names taken from the voter files of six Southern states where self-reported race is available. Our empirical validation shows that the fBISG methodology and name supplements significantly improve the accuracy of race imputation across all racial groups, and especially for Asians. The proposed methodology, together with additional name data, is available via the open-source software WRU.

研究の動機と目的

  • 人口統計データの制限に起因するベイズ的改善姓地理特定法(BISG)のマイノリティ集団におけるレース予測性能の低さを是正すること。
  • マイノリティのレース集団に対して、人口統計ブロック内にゼロカウントが存在する問題を是正すること。この問題は、BISGの予測正確性を損なう要因である。
  • とりわけ、頻度の低い姓を持つマイノリティ集団において、人口統計姓ファイルの姓カバー範囲が不十分である問題を是正すること。
  • アジア系およびヒスパニック系を含む、全主要レースカテゴリにおいて、レース帰属推定モデルの予測正確性とキャリブレーションを向上させること。
  • wruパッケージを通じて、強化された手法のオープンソース実装を提供・公開すること。

提案手法

  • 標準BISGにおけるナイーブベイズ近似を完全後確率推定に置き換える完全ベイズフレームワーク(fBISG)を導入し、人口統計カウントの測定誤差を考慮する。
  • ベイズの定理を用いてレース予測をモデル化する:P(R_i | S_i, G_i) ∝ P(S_i | R_i)P(R_i | G_i)。ここで、S_i は姓、G_i は地理的位置、R_i はレースを表す。
  • 人口統計ブロックレベルのレース割合に不確実性を組み込むために、それらを階層的事前分布を用いた確率変数として扱い、点推定ではなく完全後確率推定を可能にする。
  • 標準の姓-レース辞書に、6つの南部州の選挙人名簿から得た追加の名前(与え名およびミドルネームを含む)を組み込み、カバー範囲を拡大し、代表されにくい姓のカバー率を向上させる。
  • 姓と地理の両方の側面で情報のプールを実現する階層的モデル構造を採用し、希少姓や低カウントブロックの推定精度を向上させる。
  • 同じ南部州選挙人名簿から得た自己報告レースデータを用いて、予測のキャリブレーションを検証し、性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1マイノリティ集団の人口統計ブロックにゼロカウントが存在する場合、標準BISGの予測性能にどのような影響を与えるか?
  • RQ2人口統計姓ファイルから頻度の低い姓が除外されている場合、マイノリティ集団のレース帰属推定正確性はどの程度低下するか?
  • RQ3測定誤差を考慮する完全ベイズ的手法は、レース予測の頑健性と正確性を向上させることができるか?
  • RQ4選挙人名簿から得た与え名およびミドルネームを追加することで、レース帰属推定モデルの正確性とカバー範囲はどの程度向上するか?
  • RQ5提案手法は、異なるレースグループにおける予測確率のキャリブレーションを維持または向上させるか?

主な発見

  • fBISG手法は、全5つの主要レースグループにおける平均AUROCを標準BISGと比較して約7ポイント向上させた。アジア系有権者では最大15ポイントの向上(0.82から0.94)を達成した。
  • 完全に指定されたモデルは、全レースグループで平均14%の分類正確性向上を達成した。特にアジア系有権者において最大の向上が見られた。
  • 全改良を適用した後、非白人有権者における偽陰性率は平均18ポイント低下した。
  • 白人有権者の偽陽性率は約16ポイント低下し、白人と非白人をより正確に区別できるようになった。
  • 全レースグループにおいて、予測確率は良好にキャリブレーションされており、全グループのAUROCが全改良適用時において0.95を超えた。
  • 与え名およびミドルネームの追加により正確性が向上したが、ミドルネームを含めた場合、ヒスパニック系およびアジア系有権者においてわずかなキャリブレーション劣化が見られた。これは、名前の使用に関する文化的差異が原因である可能性が高い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。