[论文解读] How should we proxy for race/ethnicity? Comparing Bayesian improved surname geocoding to machine learning methods
本研究比较了贝叶斯改进姓氏地理编码(BISG)与机器学习(ML)模型在选民登记数据中代理种族/族裔身份的表现。基于四个拥有自报种族数据的美国州份,研究发现ML模型在个体分类中始终优于BISG,而BISG在估算区域种族构成方面表现出差异化的偏差,凸显了对代理方法进行州级特定验证的必要性。
Bayesian Improved Surname Geocoding (BISG) is the most popular method for proxying race/ethnicity in voter registration files that do not contain it. This paper benchmarks BISG against a range of previously untested machine learning alternatives, using voter files with self-reported race/ethnicity from California, Florida, North Carolina, and Georgia. This analysis yields three key findings. First, machine learning consistently outperforms BISG at individual classification of race/ethnicity. Second, BISG and machine learning methods exhibit divergent biases for estimating regional racial composition. Third, the performance of all methods varies substantially across states. These results suggest that pre-trained machine learning models are preferable to BISG for individual classification. Furthermore, mixed results across states underscore the need for researchers to empirically validate their chosen race/ethnicity proxy in their populations of interest.
研究动机与目标
- 评估机器学习模型是否在从选民登记数据中代理种族/族裔身份方面优于贝叶斯改进姓氏地理编码(BISG)。
- 评估BISG与ML方法在不同美国州份中估算区域种族构成的表现。
- 考察方法选择如何影响种族/族裔代理中的偏差与准确性,特别是在多样化的人口与地理背景下。
- 为研究人员在新数据集中选择和验证种族/族裔代理方法提供实证指导。
- 评估代理方法选择对实质性政治科学研究的影响,特别是在选区重划与投票权诉讼中的应用。
提出的方法
- 本研究使用来自加利福尼亚州、佛罗里达州、北卡罗来纳州和佐治亚州的选民登记数据,其中包含自报的种族/族裔信息,总计超过2600万条带标签的观测数据。
- BISG使用2020年人口普查的街区级数据计算地理概率,以及来自人口普查姓氏列表的姓氏特定种族比例。
- 在四州数据集上训练一系列机器学习模型,以姓氏、名字、中间名和地理位置作为特征,预测种族/族裔身份。
- 使用跨州预测评估模型的泛化能力,通过分类准确率和区域构成估算结果评估性能。
- 扩展的BISG模型整合了名字、中间名和性别等额外变量,使用跨州查找表以避免数据泄露。
- 通过分类准确率、校准度以及估算选区级种族构成中的偏差等指标评估性能。
实验结果
研究问题
- RQ1在使用选民登记数据对个体种族/族裔身份进行分类时,机器学习是否优于BISG?
- RQ2BISG与机器学习方法在不同州份中估算区域种族构成时,其偏差有何差异?
- RQ3种族/族裔代理方法的表现在不同州份和社区之间有多大程度的差异?
- RQ4与BISG相比,使用预训练的机器学习模型在政治科学和选区重划应用中的校准度与准确率如何?
- RQ5种族/族裔代理中的方法偏差对投票权、选区重划和候选人层面分析等下游研究有何影响?
主要发现
- 在所研究的四个州中,机器学习模型在个体层面的种族/族裔分类中始终优于BISG。
- BISG在估算区域种族构成时表现出不同的偏差,在加利福尼亚州高估了非裔和西班牙裔人口比例,而在佛罗里达州表现更准确。
- 所有代理方法的表现均在不同州份间存在显著差异,没有任何一种方法在所有司法管辖区都能保持一致的准确性。
- BISG在种族隔离程度较高的社区中表现更准确,但这可能在不同隔离水平的选区之间比较分析中引入偏差。
- 在多州数据上预训练的机器学习模型,相较于BISG,能为个体分类提供更准确且更优校准的种族/族裔代理结果。
- 在每个新的研究情境中对代理方法进行实证验证至关重要,因为保密限制通常会阻止对先前结果的公开审查。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。