[论文解读] How Many Workers to Ask? Adaptive Exploration for Collecting High Quality Labels
本文提出了一种用于众包的自适应停止规则,能够根据工人质量评分和答案分歧度动态确定每个HIT应查询的工人数量,显著降低费用的同时保持高水平的标签质量。通过估计HIT的难度并相应加权答案,该方法在模拟和真实数据中均优于固定预算和传统EM方法,在平均使用更少工人的前提下实现了更低的错误率。
Crowdsourcing has been part of the IR toolbox as a cheap and fast mechanism to obtain labels for system development and evaluation. Successful deployment of crowdsourcing at scale involves adjusting many variables, a very important one being the number of workers needed per human intelligence task (HIT). We consider the crowdsourcing task of learning the answer to simple multiple-choice HITs, which are representative of many relevance experiments. In order to provide statistically significant results, one often needs to ask multiple workers to answer the same HIT. A stopping rule is an algorithm that, given a HIT, decides for any given set of worker answers if the system should stop and output an answer or iterate and ask one more worker. Knowing the historic performance of a worker in the form of a quality score can be beneficial in such a scenario. In this paper we investigate how to devise better stopping rules given such quality scores. We also suggest adaptive exploration as a promising approach for scalable and automatic creation of ground truth. We conduct a data analysis on an industrial crowdsourcing platform, and use the observations from this analysis to design new stopping rules that use the workers' quality scores in a non-trivial manner. We then perform a simulation based on a real-world workload, showing that our algorithm performs better than the more naive approaches.
研究动机与目标
- 通过动态确定每个HIT所需的工人数量,解决众包中的成本-质量权衡问题。
- 通过利用已知的工人表现评分并实时估计HIT难度,提升标签质量并降低费用。
- 在不依赖昂贵人工标注的前提下,实现可扩展的、自动化的高质量标准数据集构建。
- 设计自适应的停止规则,基于答案一致性与工人可靠性动态平衡工人聚合。
- 探索基于自适应聚合与工人质量反馈实现自洽标准HIT生成的可行性。
提出的方法
- 该方法使用一种停止规则,在每次收到工人回答后进行评估,决定是否停止或请求更多工人,依据为答案方差与工人质量评分。
- 通过测量工人答案之间的分歧程度来估计HIT难度,分歧越高表示难度越大。
- 根据工人的已知质量评分与HIT的估计难度对答案进行加权,使高质量工人在困难任务上获得更高权重。
- 该算法采用基于索引的方法,平衡探索(收集更多数据)与利用(做出决策),灵感来自多臂赌博机策略。
- 假设工人质量已知,源自历史表现,使系统可专注于估计HIT难度与最终答案,而非工人可靠性。
- 通过修改得票差异与数值差异标准,将该方法扩展至处理多个正确答案与数值输出。
实验结果
研究问题
- RQ1如何在保持标签聚合低错误率的前提下,最小化每个HIT的工人数量?
- RQ2能否利用已知的工人质量评分来提升众包中标签聚合的效率与准确性?
- RQ3基于答案分歧度与工人质量的自适应停止方法,与固定预算和基于EM的方法相比表现如何?
- RQ4自适应聚合能否实现可扩展的、自动化的高质量标准数据集生成?
- RQ5HIT难度估计对工人答案加权与最终决策准确率有何影响?
主要发现
- 所提出的自适应停止规则在错误率方面显著优于固定预算与随机采样方法,尤其在困难HIT上表现更优。
- 基于索引的自适应算法相比固定预算方法,将平均成本(工人数量)降低了高达30%,同时保持相同的错误率。
- 在简单HIT上,该算法能早期停止,仅使用少量工人,减少不必要的劳动;在困难HIT上则持续收集更多答案以确保准确性。
- 该方法有效利用工人质量评分,为可靠答案分配更高权重,尤其在困难任务上显著提升了性能。
- 在真实工业平台上的实证分析表明,HIT难度近似均匀分布,验证了自适应机制的必要性。
- 模拟结果证实,在工人质量可预先知晓的场景下,自适应方法优于基于EM的方法,因估计偏差更小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。