[论文解读] A statistical model for aggregating judgments by incorporating peer predictions
本文提出了一种概率生成模型,通过整合受访者对他人答案的预测,改进了群体判断聚合。通过将个体判断和同伴预测均建模为对潜在世界状态的贝叶斯推断,该模型能够推断出最可能的真正状态——即使少数答案正确——在多种专家判断任务中,其表现优于标准聚合方法。
We propose a probabilistic model to aggregate the answers of respondents answering multiple-choice questions. The model does not assume that everyone has access to the same information, and so does not assume that the consensus answer is correct. Instead, it infers the most probable world state, even if only a minority vote for it. Each respondent is modeled as receiving a signal contingent on the actual world state, and as using this signal to both determine their own answer and predict the answers given by others. By incorporating respondent's predictions of others' answers, the model infers latent parameters corresponding to the prior over world states and the probability of different signals being received in all possible world states, including counterfactual ones. Unlike other probabilistic models for aggregation, our model applies to both single and multiple questions, in which case it estimates each respondent's expertise. The model shows good performance, compared to a number of other probabilistic models, on data from seven studies covering different types of expertise.
研究动机与目标
- 开发一种稳健的群体判断聚合方法,无需假设共识正确,也无需假设所有受访者拥有同等信息访问权限。
- 解决传统模型的局限性,这些模型假设投票者具备能力,并仅依赖多数票或加权投票,尤其在非二元或专家驱动的领域中存在不足。
- 不仅推断最可能的世界状态,还能在多个问题上推断个体受访者的专业水平,从而实现性能预测。
- 将信念聚合扩展至非二元的多选题,同时保持统计严谨性和可解释性。
- 通过利用答案和对他人回答的预测,提升现实场景(如医学诊断、政策评估和艺术品定价)中的准确性。
提出的方法
- 将每位受访者建模为接收与真实世界状态相关的私有信号,随后对可能的世界状态形成后验信念。
- 将受访者对他人答案的预测纳入生成模型,将其视为潜在分布的噪声信号。
- 使用贝叶斯推断估计潜在参数:世界状态的先验分布,以及在每种世界状态下信号的可能性,包括反事实情形。
- 应用Softmax决策规则将后验信念转换为投票行为,允许概率性答案选择。
- 通过多项分布和狄利克雷分布对先验和信号可能性进行扩展,以处理非二元问题。
- 通过截断正态分布或狄利克雷抽样引入噪声,以建模同伴预测中的不确定性,避免对预测答案分布的过度自信。
实验结果
研究问题
- RQ1与共识或基于信心加权的投票相比,整合受访者对他人答案的预测是否能提升群体判断聚合的准确性?
- RQ2在专家领域中信息分布不对称的情况下,统计模型如何在多数答案错误时仍能推断出真实世界状态?
- RQ3在缺乏真实答案或历史表现数据的情况下,该模型在多大程度上能推断出个体受访者在多个问题上的专业水平?
- RQ4该模型在非二元多选题上的表现如何?需要哪些扩展以保持准确性和可解释性?
- RQ5通过校准的噪声参数,该模型能否在同伴预测行为中考虑认知偏差(如虚假共识或虚假独特性)?
主要发现
- 与多数票、基于信心的平均值及其他概率模型等标准方法相比,该模型显著提升了聚合准确性,尤其当正确答案由少数人持有时表现更优。
- 即使共识答案错误,该模型仍能成功推断出真实世界状态,展现出在信息分布不对称的“棘手”环境中的鲁棒性。
- 该模型在七个多样化研究中表现优异,涵盖艺术品估价、皮肤病变诊断和政策评估,适用于单题和多题场景。
- 模型推断出的受访者专业水平参数具有预测个体准确性的能力,可在无真实答案的情况下识别出高绩效专家。
- 该模型在选项无固定排序的题目中保持一致性能,显示出在现实应用中的灵活性。
- 引入同伴预测可使模型准确性超越仅使用答案所能达到的水平,验证了获取他人回答预测信念的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。