Skip to main content
QUICK REVIEW

[论文解读] Neutralizing Self-Selection Bias in Sampling for Sortition

Bailey Flanigan, Paul Gölz|arXiv (Cornell University)|Jun 18, 2020
Electoral Systems and Political Participation参考文献 23被引用 8
一句话总结

本文提出一种采样算法,通过为志愿者池中的每个人分配经过校准的选择概率,以消除抽签中的自我选择偏差,从而近似实现无放回的均匀抽样。通过从调查数据中学习参与概率,并采用拒绝采样方法,该算法确保所有个体——尤其是代表性不足的子群体——的端到端选择概率接近相等,即使参与率较低,也能实现公平性和人口代表性。

ABSTRACT

Sortition is a political system in which decisions are made by panels of randomly selected citizens. The process for selecting a sortition panel is traditionally thought of as uniform sampling without replacement, which has strong fairness properties. In practice, however, sampling without replacement is not possible since only a fraction of agents is willing to participate in a panel when invited, and different demographic groups participate at different rates. In order to still produce panels whose composition resembles that of the population, we develop a sampling algorithm that restores close-to-equal representation probabilities for all agents while satisfying meaningful demographic quotas. As part of its input, our algorithm requires probabilities indicating how likely each volunteer in the pool was to participate. Since these participation probabilities are not directly observable, we show how to learn them, and demonstrate our approach using data on a real sortition panel combined with information on the general population in the form of publicly available survey data.

研究动机与目标

  • 解决因仅一小部分受邀公民自愿参与而导致的抽签面板选择中的公平性问题,以及志愿者群体与总体人口不具代表性的现象。
  • 克服现有基于贪心配额的算法的局限性,这些算法无法控制个体选择概率,可能系统性地低估具有交叉特征的少数群体。
  • 开发一种系统性方法,即使仅有一部分人自愿参与,也能在总体中所有个体之间恢复接近均匀的选择概率。
  • 在满足人口统计配额的同时,维持对个体的公平性,特别是对具有交叉特征的代表性不足群体。
  • 利用英国气候大会的真实数据,展示该方法的可行性和有效性,包括引入气候关切水平这一新特征。

提出的方法

  • 利用公开的调查数据和观察到的志愿者池数据,学习背景总体中每个人的参与概率。
  • 通过按估计的参与概率比例复制背景个体,构建一个合成总体,以模拟一个大规模且具有代表性的池。
  • 使用拒绝采样机制从志愿者池中抽取面板,其中每个人的入选概率根据其估计的参与可能性进行调整。
  • 通过受约束的采样过程,在正交特征(如性别、年龄、地区、气候关切)上强制执行人口统计配额,同时保持公平性保证。
  • 应用基于阈值的拒绝规则,仅接受满足三个关键条件(配额合规、端到端概率有界、池大小足够)的池。
  • 通过多次模拟池的平均计算,获得端到端的选择概率,确保所有个体的选择概率接近理想的 $k/n$。

实验结果

研究问题

  • RQ1我们能否设计一种抽签面板的采样算法,即使在志愿者池中存在自我选择偏差,也能为所有个体恢复相等的选择概率?
  • RQ2如何在保持个体层面公平性的同时,确保满足人口统计配额,特别是对交叉性子群体?
  • RQ3为实现总体中所有个体的近似均匀端到端选择概率,所需的最小池大小(r)是多少?
  • RQ4参与概率估计如何影响最终面板的公平性和代表性?
  • RQ5包含额外特征(如气候关切水平)在多大程度上影响采样过程的可行性和公平性?

主要发现

  • 当 $ r \geq 15,000 $ 时,合成总体中的所有个体都获得了非常接近 $ k/n $ 的端到端选择概率,表明公平性得到了有效恢复。
  • 当引入气候关切水平特征时,只有极大规模的 $ r $(例如 $ r \approx 60,000 $)才能产生任何非零的端到端概率,且即便如此,此类池也极为罕见。
  • 当气候关切特征被包含时,贪心算法在 75.4% 的随机池中无法找到有效面板,原因是‘完全不关心’个体的下限配额被违反。
  • 在 $ r = 11,000 $ 时,几乎所有池都被判定为‘差’,因为违反了端到端概率边界(公式 3),导致所有个体的端到端概率接近零。
  • 从 $ r = 11,000 $ 到 $ r = 12,000 $ 的过渡显示出端到端概率的急剧不连续性,表明存在一个公平性的临界阈值。
  • 通过使用学习到的参与可能性校准选择概率,该算法成功地在多个人口统计特征(包括交叉性群体)上维持了公平性和配额合规性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。