Skip to main content
QUICK REVIEW

[论文解读] Understanding the 2016 US Presidential Election using ecological inference and distribution regression with census microdata

Seth Flaxman, Danica J. Sutherland|arXiv (Cornell University)|Nov 11, 2016
Opinion Dynamics and Social Influence参考文献 7被引用 13
一句话总结

本文利用生态推断和分布回归方法,基于美国人口普查微观数据,估算2016年美国总统大选中按人口统计子群体划分的候选人支持率与选民 turnout。通过使用高维人口分布特征嵌入的多项对数回归,在地方层面建模选票份额与参与率,结果表明:非大学教育的白人男性对特朗普的支持率高达58%,但投票率仅为42%;而受过大学教育的白人女性则主要支持希拉里(56%),且投票率较高(53%)。

ABSTRACT

We combine fine-grained spatially referenced census data with the vote outcomes from the 2016 US presidential election. Using this dataset, we perform ecological inference using distribution regression (Flaxman et al, KDD 2015) with a multinomial-logit regression so as to model the vote outcome Trump, Clinton, Other / Didn't vote as a function of demographic and socioeconomic features. Ecological inference allows us to estimate "exit poll" style results like what was Trump's support among white women, but for entirely novel categories. We also perform exploratory data analysis to understand which census variables are predictive of voting for Trump, voting for Clinton, or not voting for either. All of our methods are implemented in Python and R, and are available online for replication.

研究动机与目标

  • 利用细致的人口统计学数据,理解2016年美国总统大选中谁支持了特朗普、希拉里或第三党/未投票者。
  • 通过在新颖的人口统计类别中实现州以下、地方层面的投票行为估算,克服出口民调和赢家通吃选举地图的局限性。
  • 对社会经济与人口统计变量的完整分布进行建模(而不仅限于均值),以揭示与投票结果之间的复杂相关性。
  • 提供基于Python和R的开源、可复现方法,用于在人口普查微观数据上进行分布回归的生态推断。
  • 通过填补选举后早期数据获取不全的空白,为选举后分析提供支持,尤其在完整调查与选民名册数据发布之前。

提出的方法

  • 将分布回归(Flaxman et al., 2015)应用于地方选区选举结果,回归基于美国社区调查中获取的个体级人口普查数据样本。
  • 使用核均值嵌入与加法特征化方法,将高维、混合类型的人口统计学数据(分类与连续变量)表示为回归用的特征向量。
  • 采用惩罚性多项对数回归模型,对三种结果进行建模:支持希拉里、支持特朗普,或选择其他/未投票,预测变量包括人口统计学特征及其交互项。
  • 利用交叉验证偏差评估模型拟合度,估算人口统计学特征(如种族、教育、收入、性别)对投票选择与参与率的边际效应。
  • 通过地方层面估计结果与边际效应图可视化,展示子群体特定的选票份额与投票率。
  • 通过PUMA与县层级数据的空间聚合,实现全国、州及地方层级的推断,同时保持人口统计学细节的粒度。

实验结果

研究问题

  • RQ1在特定人口统计子群体(如受过大学教育与未受过大学教育的白人女性)中,对特朗普、希拉里及第三党/未投票者的支持率如何?
  • RQ2人口统计分布(尤其是种族、教育与收入的联合分布)如何在地方层面预测投票选择与选民参与率?
  • RQ3哪些人口统计变量组合(如性别×种族、教育×收入)对投票结果具有最强的预测力?
  • RQ4选民参与率在不同人口统计子群体之间如何变化?哪些群体的投票率最高或最低?
  • RQ5与仅建模群体均值的传统生态推断相比,分布回归方法在建模完整特征分布后,能在多大程度上提升预测性能?

主要发现

  • 在未受过大学教育的白人男性中,58%支持特朗普,而该群体中仅有42%的合格选民参与了投票。
  • 在受过大学教育的白人女性中,56%支持希拉里,且该群体中53%的合格选民参与了投票,表明其投票率高且对民主党的支持强烈。
  • 对投票选择最具预测力的特征依次为:种族(RAC3P),种族与教育程度的交互项,以及教育程度本身,其偏差解释度分别为0.86、0.74与0.72。
  • 性别与种族的交互作用对投票选择具有显著边际效应,非裔与西班牙裔女性对希拉里的支持率高于其男性同龄人。
  • 个人收入与每周工作时长的联合分布是投票选择与参与率的强预测因子,高收入且全职工作的群体表现出更高的投票率与更强的希拉里支持倾向。
  • 模型估算显示,50%的合格男性投票支持特朗普或希拉里,而合格女性中这一比例为53%,表明投票参与率存在轻微的性别差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。