[论文解读] Avoiding Imposters and Delinquents: Adversarial Crowdsourcing and Peer Prediction
本文提出了一种鲁棒的矩阵补全框架,用于在对抗性众包环境中识别评分最高的项目,其中仅有一小部分评分者是可靠的。通过使用带有核范数约束的半定规划,并引入少量个人评分以打破对称性,该方法即使在对抗性扰动下,也能以最多 ϵ 的误差恢复前 β 分数的项目,同时要求每个评分者的计算工作量与项目总数 n 无关。
We consider a crowdsourcing model in which $n$ workers are asked to rate the quality of $n$ items previously generated by other workers. An unknown set of $αn$ workers generate reliable ratings, while the remaining workers may behave arbitrarily and possibly adversarially. The manager of the experiment can also manually evaluate the quality of a small number of items, and wishes to curate together almost all of the high-quality items with at most an $ε$ fraction of low-quality items. Perhaps surprisingly, we show that this is possible with an amount of work required of the manager, and each worker, that does not scale with $n$: the dataset can be curated with $ ilde{O}\Big(\frac{1}{βα^3ε^4}\Big)$ ratings per worker, and $ ilde{O}\Big(\frac{1}{βε^2}\Big)$ ratings by the manager, where $β$ is the fraction of high-quality items. Our results extend to the more general setting of peer prediction, including peer grading in online classrooms.
研究动机与目标
- 解决在部分评分者可能为对抗性或不可靠的众包系统中识别高质量项目的问题。
- 仅通过用户提供的少量个人评分,打破诚实与不诚实评分者之间的对称性,实现对前 β 分数项目的准确识别。
- 设计一种可扩展的算法,使每个评分者的计算工作量独立于项目总数 n,仅依赖于可靠度分数 α 和期望精度 ϵ。
- 放宽对评分者之间一致性程度的假设,允许评分者严格程度不同,只要其期望评分能诱导出相似的排名顺序。
提出的方法
- 将恢复问题建模为一个半定规划问题,目标是最大化内积 ⟨~A, M⟩,并施加对矩阵元素、行和以及核范数的约束。
- 对矩阵 M 施加核范数上界 ∥M∥∗ ≤ 2αϵαβnm,以促进低秩结构并抑制不可靠评分者带来的噪声。
- 利用一组少量的个人评分 ~r 来打破诚实与对抗性评分者之间的对称性,当 α < 1/2 时这一措施至关重要。
- 采用源自随机块模型和社区检测的矩阵补全技术,并针对稀疏、常数度数的设置进行定制。
- 依赖一种较弱的评分者间一致性形式——排名一致性,而非精确评分一致,从而增强对评分者偏见的鲁棒性。
实验结果
研究问题
- RQ1当大量评分者为对抗性时,我们能否可靠地识别出众包评分系统中的前 β 分数项目?
- RQ2在不依赖真实标签的前提下,如何打破诚实与对抗性评分者之间的对称性?
- RQ3为实现对前几项的 ϵ-近似恢复,每个评分者所需的最小工作量是多少,且该工作量与 n 无关?
- RQ4在何种程度上,该方法能容忍评分者偏见或严格程度差异,同时仍能恢复出正确的排名?
主要发现
- 以至少 99% 的概率,该算法能够恢复出 βn 个项目,其平均质量最多比真实最优集合 T∗ 损失 ϵ。
- 每个评分者所需的评分数量 k 为 O(1/βα³ϵ⁴),其随期望精度和可靠性要求的增长速度较慢。
- 用户必须亲自评分的项目数量 k₀ 为 Ω(log(1/αβϵ)/(βϵ²)),这是信息论上必需的,并且几乎达到最优。
- 即使可靠评分者在严格程度上存在差异,只要其期望评分能诱导出近似相同的排名,该方法依然有效。
- 核范数约束在抑制对抗性影响和实现弱评分者间一致性条件下的恢复中起着关键作用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。