[论文解读] Cheaper and Better: Selecting Good Workers for Crowdsourcing
本文提出了一种组合优化方法,从众包池中选择一个最小的高可靠性工作者子集,在预算约束下最大化标注准确性。通过使用无偏估计器最小化误差率的上界,该算法选择的优质工作者数量少于标准的Top-K方法,同时实现相当或更优的性能,且成本更低。
Crowdsourcing provides a popular paradigm for data collection at scale. We study the problem of selecting subsets of workers from a given worker pool to maximize the accuracy under a budget constraint. One natural question is whether we should hire as many workers as the budget allows, or restrict on a small number of top-quality workers. By theoretically analyzing the error rate of a typical setting in crowdsourcing, we frame the worker selection problem into a combinatorial optimization problem and propose an algorithm to solve it efficiently. Empirical results on both simulated and real-world datasets show that our algorithm is able to select a small number of high-quality workers, and performs as good as, sometimes even better than, the much larger crowds as the budget allows.
研究动机与目标
- 解决在众包中雇佣更多工作者是否总是能提高标注准确性的疑问。
- 在固定预算限制下,识别出能最大化准确率同时最小化工作者数量的工作者子集。
- 开发一种方法,避免依赖预设的可靠性阈值或噪声较大的估计器。
- 通过组合优化框架最小化误差率的上界,实现工作者选择的优化。
- 证明通过战略性选择,更少但高质量的工作者可优于更大规模的群体。
提出的方法
- 将工作者选择问题建模为组合优化任务,以最小化预测误差率的上界。
- 使用带线性或对数比权重函数的加权多数投票(WMV)聚合方法来估计工作者可靠性。
- 采用误差率的无偏估计器,以确保优化目标能真实反映性能分布。
- 应用对称置信区间保证,以维持可靠性估计的鲁棒性。
- 推导出全局最优算法,选择最多K名工作者的子集,使误差率最小。
- 采用基于置信区间的选取策略,避免对噪声较大的可靠性估计产生过拟合。
实验结果
研究问题
- RQ1选择少量高质量工作者是否能比使用更大规模的普通或低质量工作者群体获得更高的准确性?
- RQ2组合优化方法是否能在准确性和成本效率方面优于标准的Top-K选择策略?
- RQ3权重函数的选择(线性 vs. 对数比)如何影响聚合过程的稳定性和性能?
- RQ4为何基于EM的聚合方法在Top-K工作者上性能随K增大而下降?
- RQ5使用误差率的无偏估计器是否能带来比有偏插补估计器更好的工作者选择效果?
主要发现
- 所提算法始终选择少于K名工作者——在消歧义数据集上通常为6名或更少,在Bluebird数据集上通常为9名或更少——同时实现与Top-K选择相当或更优的准确性。
- 使用线性权重的WMV优于使用对数比权重的WMV,因为后者在金标准问题数量较少时易受极端可靠性估计的影响而产生不稳定性。
- 在Top-K工作者上使用基于EM的聚合方法会随着K增大而性能下降,原因是引入了可靠性较低的工作者,干扰了可靠性估计过程。
- 使用无偏误差率估计器相比有偏插补估计器能显著提升性能,这一结论得到实证结果的验证。
- 在真实世界数据集(消歧义和Bluebird)上,该算法所选工作者的性能与更大规模群体相当或更优,即使工作者数量被大幅减少。
- 该方法在不牺牲准确性的前提下实现了成本节约,证明了在优化选择时,质量优于数量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。