Skip to main content
QUICK REVIEW

[논문 리뷰] Addressing Census data problems in race imputation via fully Bayesian Improved Surname Geocoding and name supplements

Kosuke Imai, Santiago Olivella|arXiv (Cornell University)|2022. 05. 12.
Data-Driven Disease Surveillance인용 수 8
한 줄 요약

이 논문은 전체 베이지안 향상된 성씨 지리정보화(fBISG) 방법과 남부 미국 유권자 파일에서 유래한 성씨 보완 자료를 제안하여 인구 조사 데이터의 두 가지 핵심 문제를 해결한다: 소수자 집단에 대한 영점 수치와 성씨 파일 내 누락된 성씨. 이 방법은 인종 할당 정확도를 크게 향상시킨다—특히 아시아계 및 히스패닉계 유권자에게서는 AUROC가 최대 15%p 상승하고, 잘못된 음성 결과는 18%p 감소시키며, 모든 인종 집단에서 뛰어난 校정 성능 유지를 유지한다.

ABSTRACT

Prediction of individual's race and ethnicity plays an important role in social science and public health research. Examples include studies of racial disparity in health and voting. Recently, Bayesian Improved Surname Geocoding (BISG), which uses Bayes' rule to combine information from Census surname files with the geocoding of an individual's residence, has emerged as a leading methodology for this prediction task. Unfortunately, BISG suffers from two Census data problems that contribute to unsatisfactory predictive performance for minorities. First, the decennial Census often contains zero counts for minority racial groups in the Census blocks where some members of those groups reside. Second, because the Census surname files only include frequent names, many surnames -- especially those of minorities -- are missing from the list. To address the zero counts problem, we introduce a fully Bayesian Improved Surname Geocoding (fBISG) methodology that accounts for potential measurement error in Census counts by extending the naive Bayesian inference of the BISG methodology to full posterior inference. To address the missing surname problem, we supplement the Census surname data with additional data on last, first, and middle names taken from the voter files of six Southern states where self-reported race is available. Our empirical validation shows that the fBISG methodology and name supplements significantly improve the accuracy of race imputation across all racial groups, and especially for Asians. The proposed methodology, together with additional name data, is available via the open-source software WRU.

연구 동기 및 목표

  • 인구 조사 데이터의 한계로 인해 소수자 집단에 대한 베이지안 향상된 성씨 지리정보화(BISG)의 성능 저하 문제를 해결하기 위해.
  • 소수자 인종 집단에 대해 인구 조사 블록 내에서 영점 수치가 발생함으로써 BISG의 예측 정확도가 저하되는 문제를 수정하기 위해.
  • 특히 빈도가 낮은 성씨를 가진 소수자 집단에서 성씨 파일의 커버리지가 부족한 문제를 해결하기 위해.
  • 특히 아시아계 및 히스패닉계에 대해 모든 주요 인종 범주에서 예측 정확도와 校정 성능을 향상시키기 위해.
  • 향상된 방법론의 오픈소스 구현체를 wru 패키지를 통해 개발 및 배포하기 위해.

제안 방법

  • 표준 BISG에서 나이브 베이즈 근사치를 사용하는 것에서 벗어나 측정 오차를 고려한 완전한 사후 추론을 수행하는 전체 베이지안 프레임워크(fBISG)를 도입하여 인구 조사 수치의 측정 오차를 반영한다.
  • 베이즈 정리에 기반한 인종 예측 모델을 설정: P(R_i | S_i, G_i) ∝ P(S_i | R_i)P(R_i | G_i), 여기서 S_i는 성씨, G_i는 지리적 위치, R_i는 인종이다.
  • 인구 조사 블록 수준의 인종 비율에 대한 불확실성을 처리하기 위해 이를 무작위 변수로 간주하고 계층적 사전분포를 적용하여 점 추정치가 아닌 완전한 사후 추론을 가능하게 한다.
  • 표준 성씨-인종 사전자료에 남부 6개 주의 유권자 파일에서 유래한 추가 이름(이름과 중간 이름 포함)을 통합하여 드문 성씨의 커버리지 향상.
  • 성씨와 지리적 지역 간의 정보를 융합하는 계층적 모델링 구조를 사용하여 희귀 성씨와 수치가 적은 블록에 대한 추정 성능 향상.
  • 같은 남부 주 유권자 파일에서 확보한 자가 보고 인종 데이터를 활용하여 예측 결과를 校정하고 성능을 검증한다.

실험 결과

연구 질문

  • RQ1소수자 집단에 대해 인구 조사 블록 내에서 영점 수치가 존재할 경우 표준 BISG의 예측 성능에 어떤 영향을 미치는가?
  • RQ2인구 조사 성씨 파일에서 빈도가 낮은 성씨가 제외될 경우 소수자 인구 집단의 인종 할당 정확도는 얼마나 떨어지는가?
  • RQ3측정 오차를 고려한 전체 베이지안 접근법이 인종 예측의 강건성과 정확도를 향상시킬 수 있는가?
  • RQ4유권자 파일에서 첫 이름과 중간 이름을 추가함으로써 인종 할당 모델의 정확도와 커버리지가 얼마나 향상되는가?
  • RQ5제안된 방법은 다양한 인종 집단 간에 예측 확률의 校정 성능을 유지하거나 향상시키는가?

주요 결과

  • fBISG 방법은 표준 BISG 대비 모든 5개 주요 인종 집단의 평균 AUROC를 약 7%p 향상시켰으며, 아시아계 유권자에서는 최대 15%p 상승(0.82에서 0.94로)했다.
  • 완전히 명시된 모델은 모든 인종 집단에서 평균 14%의 분류 정확도 향상을 이룩했으며, 특히 아시아계 유권자에서 가장 큰 향상이 관찰되었다.
  • 모든 개선 조치를 시행한 후 비백인 유권자 집단에서 잘못된 음성 결과 비율이 평균 18%p 감소했다.
  • 백인 유권자 집단의 잘못된 양성 결과 비율은 거의 16%p 감소하여 백인과 비백인 개인 간의 분류 능력 향상이 확인되었다.
  • 예측 확률은 모든 인종 집단에서 잘 校정되어 있었으며, 모든 개선 조치를 적용한 후 모든 집단의 AUROC 값이 0.95를 초과했다.
  • 이름과 중간 이름의 포함은 정확도 향상에 기여했지만, 히스패닉계 및 아시아계 유권자에서 중간 이름을 포함할 경우 약간의 校정 성능 저하가 발생했으며, 이는 이름 사용 방식의 문화적 차이로 인한 것으로 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.