Skip to main content
QUICK REVIEW

[論文レビュー] Using Poisson Binomial GLMs to Reveal Voter Preferences

Evan T. R. Rosenman, Nitin Viswanathan|arXiv (Cornell University)|Feb 4, 2018
Electoral Systems and Political Participation参考文献 17被引用数 3
ひとこと要約

この論文は、集計された選挙区レベルの選挙データから個人の投票傾向を推定するための、新しいポアソン二項分布一般化線形モデル(GLM)を提案する。訓練を効率的に行うために、ライアプノフ中心極限定理による正規近似を用いる。2016年ペンシルバニア州選挙データに適用した結果、個人の投票行動を高い正確性で予測でき、都市部に住むこと、投票登録の有無、人口統計的要因が、クリントンまたはトランプ支持の主要な予測要因であることが明らかになった。

ABSTRACT

We present a new modeling technique for solving the problem of ecological inference, in which individual-level associations are inferred from labeled data available only at the aggregate level. We model aggregate count data as arising from the Poisson binomial, the distribution of the sum of independent but not identically distributed Bernoulli random variables. We relate individual-level probabilities to individual covariates using both a logistic regression and a neural network. A normal approximation is derived via the Lyapunov Central Limit Theorem, allowing us to efficiently fit these models on large datasets. We apply this technique to the problem of revealing voter preferences in the 2016 presidential election, fitting a model to a sample of over four million voters from the highly contested swing state of Pennsylvania. We validate the model at the precinct level via a holdout set, and at the individual level using weak labels, finding that the model is predictive and it learns intuitively reasonable associations.

研究の動機と目的

  • 集計された選挙区レベルの票数のみから、個人レベルの投票傾向を推定することで、生態的推定問題に取り組む。
  • ポアソン二項分布に従う集計データに一般化線形モデルをフィットさせるための計算的に効率的な手法を開発する。
  • 集計レベルのホールドアウトセットと弱ラベル付きの個人レベルデータを用いて、モデルの予測性能を検証する。
  • 現実の米国選挙において、個人の共変量と投票傾向との間の直感的で解釈可能な関係を明らかにする。
  • ベイズ的またはカーネルベースの生態的推定手法に対する頻度主義的代替手法を提供し、モデルの解釈性を高める。

提案手法

  • 集計票数を、独立ではあるが同一分布でないベルヌーイ試行の和としてモデル化する。
  • ロジスティック回帰とニューラルネットワークを用いて、個人の共変量を個人レベルの投票確率に関連付ける。
  • ライアプノフ中心極限定理を用いたポアソン二項分布への正規近似を適用し、勾配に基づく最適化を効率的に行う。
  • 大規模データセット上でモデルを訓練するために、ポアソン二項分布の負の対数尤度を最小化する。
  • 選挙区レベルのホールドアウトセットと2つの弱ラベル付き個人レベルテストセットを用いて、モデルの性能を検証する。
  • モデル評価と尤度計算のため、ポアソン二項分布の累積分布関数(CDF)を計算するために、Rパッケージ poibin を使用する。

実験結果

リサーチクエスチョン

  • RQ1ポアソン二項分布GLMは、集計された選挙区レベルの票数のみから、個人の投票傾向を正確に推定できるか?
  • RQ2政党登録、性別、年齢、居住地などの個人の共変量は、ペンシルバニア州におけるクリントンまたはトランプ支持をどのように予測するか?
  • RQ3提案されたポアソン二項分布への正規近似は、大規模選挙データに対して効率的かつスケーラブルなモデルフィッティングを可能にするか?
  • RQ4モデルの予測性能は、選挙区レベルと個人レベルの両方で検証した場合、どのように比較されるか?
  • RQ5異なる共変量の相対的な強さは、個人の投票行動を予測する上でどの程度であり、直感的な期待と一致するか?

主な発見

  • ホールドアウトセットを用いた選挙区レベルでの評価で、高い予測正確性を達成し、集計レベルでの妥当性が確認された。
  • 個人レベルでは、予備選挙の参加状況から得た弱ラベルを用いても、強力な予測性能を示し、個人の投票傾向を推定できる能力が検証された。
  • クリントン支持の最も強い予測要因は、アパートに住んでいることであり、次に民主党登録者であったことであった。アパート住まいの係数は1.246であった。
  • モデルは、登録共和党員であることが、登録民主党員であることがクリントン支持の予測要因であるよりも、トランプ支持の予測に強く関連していることを示した。それぞれの係数は-1.328および1.028であった。
  • 「2012年に立会い投票をした」(-0.183)および「郡の白人割合(%)」(-0.158)の負の係数は、高齢で白人で、2012年に立会い投票をした人々がクリントン支持の可能性が低かったことを示している。
  • 年齢(年齢/40にスケーリング)の係数が-0.562であったことから、年齢が高いほどクリントン支持の可能性が低くなる傾向があることが示され、観察された傾向と整合的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。