[論文レビュー] Understanding the 2016 US Presidential Election using ecological inference and distribution regression with census microdata
本稿では、米国国勢調査マイクロデータを用いて生態的推論と分布回帰を実施し、2016年大統領選挙における人口統計的サブグループごとの候補者支持率と有権者投票率を推定する。高次元の人口統計的分布の特徴量埋め込みを用いた多項ロジット回帰により、地方レベルでの投票率と参加率をモデル化することで、白人で非大学教育を受けた男性はトランプ支持率が58%に達し、有権者全体の42%しか投票しなかったのに対し、大学教育を受けた白人女性はクリントン支持率が56%に達し、高い投票率(53%)を示したことが明らかになった。
We combine fine-grained spatially referenced census data with the vote outcomes from the 2016 US presidential election. Using this dataset, we perform ecological inference using distribution regression (Flaxman et al, KDD 2015) with a multinomial-logit regression so as to model the vote outcome Trump, Clinton, Other / Didn't vote as a function of demographic and socioeconomic features. Ecological inference allows us to estimate "exit poll" style results like what was Trump's support among white women, but for entirely novel categories. We also perform exploratory data analysis to understand which census variables are predictive of voting for Trump, voting for Clinton, or not voting for either. All of our methods are implemented in Python and R, and are available online for replication.
研究の動機と目的
- 細分化された人口統計的データを用いて、2016年米国大統領選挙において、トランプ、クリントン、第三党候補または投票しない人々の支持者層を理解すること。
- 出口アンケートや勝者全員制の選挙地図に起因する制限を克服し、新たな人口統計的カテゴリーを用いて、州以下の地方レベルでの投票行動の推定を可能にすること。
- 平均値だけでなく、社会経済的および人口統計的変数の完全な分布をモデル化することで、投票結果との複雑な相関関係を解明すること。
- PythonおよびRを用いた国勢調査マイクロデータにおける分布回帰を用いた生態的推論のオープンソースで再現可能な手法を提供すること。
- 完全なアンケート調査や有権者名簿データが公開されるまでの早期段階で、後続の選挙分析を補完するためのデータギャップを埋めること。
提案手法
- Flaxmanら(2015)の分布回帰を応用し、アメリカ・コミュニティ・サーベイの個人レベルの国勢調査データのサンプルを用いて、地域レベルの選挙結果を回帰分析する。
- カーネル平均埋め込みと加法的特徴量化を用いて、カテゴリカルおよび連続変数を含む高次元の混合型人口統計的データ(カテゴリカルおよび連続)を回帰用の特徴量ベクトルに変換する。
- ペナルティ付き多項ロジスティック回帰を用いて、3つの結果変数(クリントン支持、トランプ支持、その他/投票しない)をモデル化し、人口統計的予測子およびその相互作用を含む。
- 交差検証によるデビアンスを用いて、人口統計的特徴量(例:人種、教育、収入、性別)が投票選択および参加率に与える限界効果を推定し、モデルの適合度を評価する。
- 地方レベルの推定値および限界効果プロットを可視化し、サブグループごとの投票率と参加率を示す。
- PUMAおよび郡レベルのデータを空間的に集約することで、全国的・州的・地方的推論を可能にしつつ、人口統計的詳細を保持する。
実験結果
リサーチクエスチョン
- RQ1白人女性のうち、大学教育を受けた者とそうでない者では、トランプ、クリントン、第三党候補または投票しない人々に対する支持率はどの程度であったか?
- RQ2特に人種、教育、収入の同時分布が、地方レベルでの投票選択および有権者参加率にどのように予測されるか?
- RQ3性別×民族、教育×収入といった人口統計的変数の組み合わせの中で、投票結果を最もよく予測するものはどれか?
- RQ4有権者参加率は人口統計的サブグループごとにどのように変化し、どのグループが最も高いまたは最も低い投票率を示したか?
- RQ5平均値ではなく、特徴量の完全な分布をモデル化することで、従来の生態的推論に比べ、分布回帰手法がどの程度改善をもたらすか?
主な発見
- 非大学教育を受けた白人男性の間では、58%がトランプを支持し、有権者全体の42%しか投票しなかった。
- 大学教育を受けた白人女性の間では、56%がクリントンを支持し、有権者全体の53%が投票したため、高い参加率と強い民主党支持が確認された。
- 投票選択の予測に最も寄与した特徴量は、人種(RAC3P)、教育水準と民族の交互作用、および教育水準で、それぞれデビアンスの説明率が0.86、0.74、0.72であった。
- 性別と民族の交互作用は、投票選択に顕著な限界効果を示し、黒人およびヒスパニック系女性は男性に比べてクリントン支持率が高かった。
- 収入と1週間の労働時間の同時分布は、投票選択および参加率の両方に対して強い予測要因であった。高収入かつフルタイム労働者では、参加率が高く、クリントン支持も強かった。
- モデル推定によると、有権者全体の50%の男性がトランプまたはクリントンに投票したが、女性は53%であったため、有権者参加における性別格差はわずかであった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。