Skip to main content
QUICK REVIEW

[論文レビュー] A statistical model for aggregating judgments by incorporating peer predictions

John McCoy, Dražen Prelec|arXiv (Cornell University)|Mar 14, 2017
Bayesian Modeling and Causal Inference参考文献 7被引用数 7
ひとこと要約

本論文は、回答者自身が他の人の回答についての予測を組み込むことで、グループ判断の集約を改善する確率的生成モデルを提案する。個々の判断と同僚の予測を、潜在的な世界状態に関するベイズ推論としてモデル化することで、少数派の回答が正しければ真の状態を最も確率の高いものとして推定する。本モデルは、多様な専門的判断タスクにおいて、標準的な集約手法を上回る性能を示す。

ABSTRACT

We propose a probabilistic model to aggregate the answers of respondents answering multiple-choice questions. The model does not assume that everyone has access to the same information, and so does not assume that the consensus answer is correct. Instead, it infers the most probable world state, even if only a minority vote for it. Each respondent is modeled as receiving a signal contingent on the actual world state, and as using this signal to both determine their own answer and predict the answers given by others. By incorporating respondent's predictions of others' answers, the model infers latent parameters corresponding to the prior over world states and the probability of different signals being received in all possible world states, including counterfactual ones. Unlike other probabilistic models for aggregation, our model applies to both single and multiple questions, in which case it estimates each respondent's expertise. The model shows good performance, compared to a number of other probabilistic models, on data from seven studies covering different types of expertise.

研究の動機と目的

  • コンSENSUS が正しいと仮定せず、すべての回答者が同等の情報にアクセスできると仮定しない、堅牢なグループ判断集約手法の開発を目的とする。
  • 投票者の能力を仮定し、単に過半数または加重投票に依存する伝統的なモデルの限界を克服することを目的とし、とりわけ非二値または専門的ドメインにおいて有効である。
  • 最も確率の高い世界状態を推定するだけでなく、複数の質問にわたる回答者の専門性を推定し、性能予測を可能とすることを目的とする。
  • 統計的厳密性と解釈可能性を保ちつつ、非二値の多択問題への信念集約を拡張することを目的とする。
  • 医療診断、政策評価、アート価格設定などの現実世界の文脈において、正解の正確性を向上させるために、回答と他の人の回答に関する予測の両方を活用することを目的とする。

提案手法

  • 各回答者を、真の世界状態に依存する私的信号を受信するものとモデル化し、可能な世界状態の上での事後確信度を形成する。
  • 回答者が他の人の回答についての予測を生成モデルに組み込み、それらを潜在的分布のノイズの多い信号とみなす。
  • ベイズ推論を用いて、潜在パラメータ(世界状態の事前分布および各世界状態下での信号の尤度、含め反事後的状況)を推定する。
  • ソフトマックス意思決定ルールを適用して、事後確信度を投票行動に変換し、確率的選択を可能にする。
  • 多項分布およびディリクレ分布を事前分布および信号尤度に用いて、非二値の質問へのモデルの拡張を実現する。
  • 切り捨て正規分布またはディリクレ分布からのサンプリングによるノイズ注入を用いて、同僚予測の不確実性をモデル化し、予測された回答分布に対する過信を回避する。

実験結果

リサーチクエスチョン

  • RQ1他の人の回答についての予測を組み込むことで、コンSENSUS や信頼度加重平均と比較して、グループレベルの判断集約の正確性が向上するか。
  • RQ2過半数の回答が誤りである場合でも、真の世界状態を推定できる統計モデルは、情報の非対称性が顕著な専門的ドメインでどのように機能するか。
  • RQ3真の正解や歴史的パフォーマンスデータにアクセスできない状況でも、複数の質問にわたる回答者の専門性をどの程度正確に推定できるか。
  • RQ4非二値の多択問題において、本モデルはどの程度の性能を示し、正確性と解釈可能性を維持するためにはどのような拡張が必要か。
  • RQ5校正されたノイズパラメータを用いることで、誤ったコンセンサスや誤った独自性の認知バイアスを、同僚予測行動に組み込むことができるか。

主な発見

  • 本モデルは、過半数票、信頼度加重平均、および他の確率的モデルと比較して、集約の正確性を顕著に向上させる。特に、正解が少数派に属する場合に顕著である。
  • コンセンサスの回答が誤りであっても、真の世界状態を効果的に推定できることを示し、情報の非対称性が顕著な「悪質な」環境でも頑健であることを実証した。
  • 本モデルは、アート価格推定、皮膚腫瘍診断、政策評価を含む7つの多様な研究において、単一および複数の質問に対して優れた性能を発揮した。
  • 本モデルが推定する回答者レベルの専門性パラメータは、個々の正確性を予測可能であり、真の正解がなくても、高精度な専門家を同定可能である。
  • 選択肢の順序が一貫しない状況でも、本モデルは一貫した性能を維持しており、現実世界の応用における柔軟性を示している。
  • 同僚の予測を組み込むことで、回答のみを用いた場合を上回るモデルの正確性が向上し、他の人の回答に関する予測信念を収集することの価値を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。