Skip to main content
QUICK REVIEW

[논문 리뷰] Cluster-based name embeddings reduce ethnic disparities in record linkage quality under realistic name corruption: evidence from the North Carolina Voter Registry

Joseph Lam, Mario Cortina-Borja|arXiv (Cornell University)|2026. 01. 12.
Data Quality and Management인용 수 0
한 줄 요약

논문은 클러스터 기반 이름 임베딩과 TF-adjusted 성 비교를 결합한 레코드 연결에서 인종별 불평등의 과소 연결 문제를 realistic name corruptions 하에서 줄이는 것을 NC Voter Registry 데이터로 보여준다.

ABSTRACT

Differential ethnic-based record linkage errors can bias epidemiologic estimates. Prior evidence often conflates heterogeneity in error mechanisms with unequal exposure to error. Using snapshots of the North Carolina Voter Registry (Oct 2011-Oct 2022), we derived empirical name-discrepancy profiles to parameterise realistic corruptions. From an Oct 2022 extract (n=848,566), we generated five replicate corrupted datasets under three settings that separately varied mechanism heterogeneity and exposure inequality, and linked records back to originals using unadjusted Jaro-Winkler, Term Frequency (TF)-adjusted Jaro-Winkler, and a cluster-based forename-embedding comparator combined with TF-adjusted surname comparison. We evaluated false match rate (FMR), missed match rate (MMR) and white-centric disparities. At a fixed MMR near 0.20, overall error rates and ethnic disparities diverged substantially by model under disproportionate exposure to corruption. Term-frequency (TF)-adjusted Jaro-Winkler achieved very low overall FMR (0.55% (95% CI 0.54-0.57)) at overall MMR 20.34% (20.30-20.39), but large white-centric under-linkage disparities persisted: Hispanic voters had 36.3% (36.1-36.6) and Non-Hispanic Black voters 8.6% (8.6-8.7) higher FMRs compared to Non-Hispanic White groups. Relative to unadjusted string similarity, TF adjustment reduced these disparities (Hispanic: +60.4% (60.1-60.7) to +36.3%; Black: +13.1% (13.0-13.2) to +8.6%). The cluster-based forename-embedding model reduced missed-match disparities further (Hispanic: +10.2% (9.8-10.3); Black: +0.6% (0.4-0.7)), but at a cost of increasing overall FMR (4.28% (4.22-4.35)) at the same threshold. Unequal exposure to identifier error drove substantially larger disparities than mechanism heterogeneity alone; cluster-based embeddings markedly narrowed under-linkage disparities beyond TF adjustment.

연구 동기 및 목표

  • 역학 연구 추정치에서 차별적 인종 기반 기록 연결 오류를 동기화하고 정량화한다.
  • NC Voter Registry 데이터의 경험적 불일치 프로파일을 이용해 현실적인 이름 오염을 매개화한다.
  • 오염 시나리오 전반에 걸쳐 미조정, TF-adjusted, 그리고 클러스터 기반 임베딩의 연계 방법을 비교한다.
  • 오류에 대한 노출의 불평등이 연결 품질의 불평등에 기여하는 정도를 평가한다.

제안 방법

  • NC Voter Registry 스냅샷(Oct 2011-Oct 2022)에서 경험적 이름 차이 프로파일을 구성한다.
  • 2022-10 추출물에서 세 가지 기제 이질성과 노출 불평등 설정 하에 다섯 개의 재현된 손상 데이터 세트를 생성한다( n=848,566 ).
  • 세 가지 판독기로 원본과 기록을 연결한다: unadjusted Jaro-Winkler, TF-adjusted Jaro-Winkler, 그리고 cluster-based forename-embedding with TF-adjusted surname comparison.
  • 오류의 허위 매칭 비율(FMR), 놓친 매칭 비율(MMR), 그리고 방법 간 백인 중심 차이를 평가한다.
  • 고정된 MMR ~0.20에서 성능을 분석하여 전체 오차율과 차이를 비교한다.

실험 결과

연구 질문

  • RQ1다양한 이름 연결 알고리즘이 현실적인 이름 오염과 오류 노출이 달라질 때 어떻게 성능을 보이는가?
  • RQ2클러스터 기반 forename 임베딩이 문자열 유사성만 사용하는 것에 비해 FALSE 및 MISSED 매칭의 인종 차이를 줄이는가?
  • RQ3식별자 오류에 대한 불평등한 노출이 기제 이질성보다 차이에 미치는 영향은 무엇인가?
  • RQ4TF-adjusted 유사도 측정과 클러스터 기반 임베딩이 전체 오차 트레이드를 고려하면서 백인 중심의 under-linkage 차이를 좁힐 수 있는가?

주요 결과

  • TF-adjusted Jaro-Winkler는 전체 FMR을 매우 낮게 달성하지만 (~0.55%) MMR ~20.34%에서 흰색 중심 차이가 여전히 상당하다.
  • Unadjusted 비교에서 Hispanic 및 Non-Hispanic Black 그룹은 Non-Hispanic White 그룹보다 FMR이 더 높으며; TF 조정으로 격차가 감소한다.
  • Cluster-based forename-embedding with TF-adjusted surname comparison은 놓친 매칭의 격차를 더 줄인다 (Hispanic +10.2% vs +36.3%; Black +0.6% vs +8.6%), 그러나 전체 FMR은 4.28%로 증가한다.
  • 동일 임계값에서 손상에 대한 불평등한 노출은 기제 이질성보다 더 큰 차이를 만들어 내며, cluster-based 임베딩은 TF 조정 이상의 under-linkage 차이를 현저히 좁힌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.