Skip to main content
QUICK REVIEW

[論文レビュー] Sequential Peer Prediction: Learning to Elicit Effort using Posted Prices

Yang Liu, Yiling Chen|arXiv (Cornell University)|Nov 28, 2016
Mobile Crowdsensing and Crowdsourcing被引用数 8
ひとこと要約

本稿では、集団労働者に対する報酬の最適水準を事前にその労働者の異質なコストや専門性を知らないまま動的に学習できる、逐次的な提示価格メカニズムを提案する。このメカニズムは、最適報酬の学習におけるレグレットバウンドを $ ilde{O}(T^{3/4})$ に保証し、非合理的な労働者であっても、平均場仮定の下で、努力と真実の報告を促すしきい値戦略が均衡に達することを保証する。

ABSTRACT

Peer prediction mechanisms are often adopted to elicit truthful contributions from crowd workers when no ground-truth verification is available. Recently, mechanisms of this type have been developed to incentivize effort exertion, in addition to truthful elicitation. In this paper, we study a sequential peer prediction problem where a data requester wants to dynamically determine the reward level to optimize the trade-off between the quality of information elicited from workers and the total expected payment. In this problem, workers have homogeneous expertise and heterogeneous cost for exerting effort, both unknown to the requester. We propose a sequential posted-price mechanism to dynamically learn the optimal reward level from workers' contributions and to incentivize effort exertion and truthful reporting. We show that (1) in our mechanism, workers exerting effort according to a non-degenerate threshold policy and then reporting truthfully is an equilibrium that returns highest utility for each worker, and (2) The regret of our learning mechanism w.r.t. offering the optimal reward (price) is upper bounded by $ ilde{O}(T^{3/4})$ where $T$ is the learning horizon. We further show the power of our learning approach when the reports of workers do not necessarily follow the game-theoretic equilibrium.

研究の動機と目的

  • 真の正解の検証が不可能な状況下で、作業者の努力を引き出し、支払いコストをバランスさせる実用的なピア予測メカニズムを設計すること。
  • 作業者の努力コストと専門性が未知で多様な状況下で、最適報酬水準を学習可能とすること。
  • すべての作業者が努力と真実の報告をしきい値戦略によって行う高効用均衡が形成されることを保証すること。
  • 平均場仮定の下で、作業者が完全にゲーム理論的合理性に従わない場合でも、メカニズムの頑健性を拡張すること。
  • 作業者から報告された答えのみに依存することで、情報要求を最小限に抑え、コストの開示などの追加負担を回避すること。

提案手法

  • メカニズムは、作業者からの報告に基づいて、異なる報酬水準を段階的に探索・活用するマルチアームバンディットフレームワークを用いる。
  • 作業者は報酬が自らの私的コストしきい値を上回る場合にのみ努力を示すというしきい値戦略を採用し、戦略的インcentiveが真実の報告と一致するようにする。
  • 作業者間の一致確率を推定することで、下位の正確性や集団レベルの専門性を推定し、直接的なコスト報告なしに学習を可能にする。
  • 個々の合理性が緩和された状況での集団レベルの正確性推定を簡素化するために、平均場仮定を導入する。
  • レグレット解析により、最適固定報酬に対する累積損失をバウンドし、集中不等式と探索・活用フェーズの和分のバウンドを用いる。
  • メカニズムは最小限のものであり、作業者からのタスク回答のみを必要とし、コスト開示などの追加報告負担を回避する。

実験結果

リサーチクエスチョン

  • RQ1事前に作業者のコストや専門性を知らない状況下で、逐次的ピア予測メカニズムがリアルタイムに最適報酬水準を学習できるか?
  • RQ2動的提示価格下で、しきい値に基づく努力戦略と真実の報告が高効用均衡を形成するか?
  • RQ3時間枠 $T$ の間に、最適固定報酬に対する学習メカニズムのレグレットバウンドは何か?
  • RQ4作業者が完全に合理的でない場合でも、集団レベルの行動に関する妥当な仮定の下で、メカニズムは効果を保つことができるか?
  • RQ5作業者間の一致確率は、真の正解が存在しない状況で、下位の正確性を推定し、学習を支援するためにどのように利用できるか?

主な発見

  • 提案されたメカニズムは、最適固定報酬水準に対するレグレットバウンドを $ ilde{O}(T^{3/4})$ に達成し、時間経過に伴う効率的な学習を保証する。
  • 作業者は、非退化したしきい値戦略による努力と真実の報告に従うことで、最大のユーティリティを達成し、安定な均衡を形成する。
  • メカニズムは、単純な無情報の報告戦略を回避できるピア予測の基盤に基づいているため、共謀に対して耐性がある。
  • 平均場仮定の下で、作業者が完全に合理的でない場合でも、メカニズムは一般化され、学習パフォーマンスを維持する。
  • メカニズムは最小限のものであり、作業者からの報告された答えのみを必要とし、作業者の私的コストの開示は不要である。
  • 理論的解析により、探索と活用フェーズがレグレットを最小限に抑えるようにバランスされ、和分および集中の技法を用いて明示的なバウンドが導出された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。