Skip to main content
QUICK REVIEW

[论文解读] Crowdsourced Task Routing via Matrix Factorization

Hyun Joon Jung, Matthew Lease|arXiv (Cornell University)|Oct 18, 2013
Mobile Crowdsensing and Crowdsourcing参考文献 17被引用 8
一句话总结

本文提出使用矩阵分解(MF)基于工作者过往表现预测其在新任务上的准确率,实现智能任务路由以提升质量。通过奇异值分解(SVD)和概率矩阵分解(PMF)建模任务相似性,该方法在准确率预测和识别顶尖工作者方面优于基线方法,尤其在数据稀疏且存在垃圾用户的情况下表现更优。

ABSTRACT

We describe methods to predict a crowd worker's accuracy on new tasks based on his accuracy on past tasks. Such prediction provides a foundation for identifying the best workers to route work to in order to maximize accuracy on the new task. Our key insight is to model similarity of past tasks to the target task such that past task accuracies can be optimally integrated to predict target task accuracy. We describe two matrix factorization (MF) approaches from collaborative filtering which not only exploit such task similarity, but are known to be robust to sparse data. Experiments on synthetic and real-world datasets provide feasibility assessment and comparative evaluation of MF approaches vs. two baseline methods. Across a range of data scales and task similarity conditions, we evaluate: 1) prediction error over all workers; and 2) how well each method predicts the best workers to use for each task. Results show the benefit of task routing over random assignment, the strength of probabilistic MF over baseline methods, and the robustness of methods under different conditions.

研究动机与目标

  • 为解决类似MTurk等众包平台中因工作者自主选择导致的任务分配不理想问题,以提升工作质量。
  • 通过仅使用过往表现数据预测工作者在新任务上的准确率,实现更优的任务路由,无需特征表示。
  • 评估矩阵分解方法在不同数据稀疏性和任务相似性条件下,是否能稳健预测工作者准确率并识别顶尖工作者。
  • 评估垃圾用户对预测性能和路由有效性的影响。
  • 对比基于MF的方法(SVD、PMF)与基线方法(平均值、加权平均值)在预测准确率和顶尖工作者识别方面的表现。

提出的方法

  • 构建一个工作者-任务矩阵,其中每个条目表示某位工作者在过往任务中的观测准确率,基于真实样本进行评估。
  • 应用两种矩阵分解技术——奇异值分解(SVD)和概率矩阵分解(PMF),以预测工作者在新任务上的未观测准确率。
  • 利用共享工作者表现模式推导的任务相似性,更有效地整合过往任务准确率,提升预测性能。
  • 将工作者-任务表现建模为低秩矩阵分解问题,即使在数据稀疏时也能实现稳健预测。
  • 根据预测准确率对工作者进行排序,以识别最优秀的前-k名,用于新任务的路由。
  • 使用均方根误差(RMSE)衡量整体预测准确率,使用前-k名工作者的平均准确率衡量路由有效性,与真实值进行对比。

实验结果

研究问题

  • RQ1在预测工作者准确率时,基于矩阵分解的预测性能如何随任务相似性、矩阵规模和密度变化?
  • RQ2将任务路由至预测的前-k名工作者是否优于随机分配?在此方面,PMF和SVD与基线方法相比表现如何?
  • RQ3MF-based预测对工作者池中垃圾用户的存在是否具有鲁棒性?
  • RQ4在不同数据规模和任务相似性条件下,预测误差和顶尖工作者识别准确率如何变化?
  • RQ5在真实世界和合成数据设置下,PMF与SVD及基线方法(平均值、加权平均值)的相对性能如何?

主要发现

  • 与基线相比,矩阵分解方法(尤其是PMF)显著降低了预测误差(RMSE),且随着任务相似性增加,RMSE持续下降。
  • 在包含443名工作者和3项任务的真实MTurk数据上,PMF的RMSE为0.211,优于SVD(0.170)和随机分配(0.317)。
  • 在前10名工作者预测(MA10)中,PMF的平均准确率为0.773,显著优于随机分配(0.381)和SVD(0.609)。
  • 即使存在垃圾用户,顶尖k名工作者的识别性能依然稳健,因高准确率工作者与低绩效者可清晰区分。
  • 随着k值增大,PMF在识别最准确工作者方面始终优于SVD和基线方法(平均值、加权平均值)。
  • 在合成数据和真实世界数据中,MA10随k增加而下降的趋势一致,证实了模型在实际场景中的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。