[论文解读] Using Poisson Binomial GLMs to Reveal Voter Preferences
本文提出一种新颖的泊松二项式广义线性模型(GLM),通过正态近似(基于Lyapunov中心极限定理)实现高效训练,利用聚类级别的选举数据推断个体选民偏好。将该模型应用于2016年宾夕法尼亚州选举数据,能够以高精度预测个体投票行为,揭示城市化程度、政党注册情况及人口统计因素是影响克林顿或特朗普支持率的关键预测变量。
We present a new modeling technique for solving the problem of ecological inference, in which individual-level associations are inferred from labeled data available only at the aggregate level. We model aggregate count data as arising from the Poisson binomial, the distribution of the sum of independent but not identically distributed Bernoulli random variables. We relate individual-level probabilities to individual covariates using both a logistic regression and a neural network. A normal approximation is derived via the Lyapunov Central Limit Theorem, allowing us to efficiently fit these models on large datasets. We apply this technique to the problem of revealing voter preferences in the 2016 presidential election, fitting a model to a sample of over four million voters from the highly contested swing state of Pennsylvania. We validate the model at the precinct level via a holdout set, and at the individual level using weak labels, finding that the model is predictive and it learns intuitively reasonable associations.
研究动机与目标
- 通过仅使用聚类级别的总票数,解决生态推断问题,推断个体层面的投票偏好。
- 开发一种计算高效的广义线性模型拟合方法,适用于泊松二项分布的聚合数据。
- 通过聚类级别的保留数据集和弱标签个体数据集,验证模型的预测能力。
- 揭示真实美国选举中个体协变量与投票偏好的直观、可解释的关联。
- 提供一种频率学派替代方法,相较于贝叶斯或核方法,具有更高的模型可解释性。
提出的方法
- 将聚合票数建模为泊松二项分布的实现——即独立但非同分布的伯努利试验之和。
- 使用逻辑回归和神经网络,将个体协变量与个体投票概率相关联。
- 通过Lyapunov中心极限定理对泊松二项分布应用正态近似,以支持基于梯度的高效优化。
- 通过最小化泊松二项分布的负对数似然,实现对大规模数据集的模型训练。
- 使用聚类级别的保留数据集和两组弱标签个体数据集验证模型性能。
- 使用poibin R包计算泊松二项分布的CDF,用于模型评估和似然计算。
实验结果
研究问题
- RQ1泊松二项式GLM能否仅基于聚类级别的总票数准确推断个体选民偏好?
- RQ2在宾夕法尼亚州,政党注册、性别、年龄和居住地等个体协变量如何预测对克林顿或特朗普的支持?
- RQ3所提出的泊松二项分布正态近似是否能实现在大规模选举数据上的高效且可扩展的模型拟合?
- RQ4当在聚类和个体两个层面进行验证时,模型的预测性能如何比较?
- RQ5不同协变量在预测个体投票行为中的相对优势如何?其结果是否符合直观预期?
主要发现
- 使用聚类级别的保留数据集,模型在聚合层面表现出高预测精度,验证了其有效性。
- 在个体层面,模型利用初选参与情况的弱标签数据,展现出强大的预测性能,验证了其推断个体偏好的能力。
- 对克林顿支持最强的预测变量是居住在公寓中,其次为注册为民主党人,其中公寓居住者的系数为1.246。
- 模型发现,注册为共和党人是支持特朗普的更强预测因子,其系数为-1.328,而注册为民主党的人对克林顿的支持系数为1.028。
- ‘2012年现场投票’(系数-0.183)和‘县白人占比’(系数-0.158)的负系数表明,年长、白人且曾现场参与初选的选民更不可能支持克林顿。
- 年龄(标准化为Age/40)的模型系数为-0.562,表明年龄较大的个体更不可能支持克林顿,与观察到的趋势一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。