[论文解读] Cost-Effective HITs for Relative Similarity Comparisons
本文提出一种基于网格的用户界面,用于众包三元组相似性比较,使研究人员每屏可收集多达48个三元组,显著提升了效率并降低了成本。与传统的逐个三元组比较的UI相比,该方法在更低的经济成本下提升了嵌入质量,其中16选4的网格布局效果最佳,且使工作者时薪超过10美元。
Similarity comparisons of the form "Is object a more similar to b than to c?" are useful for computer vision and machine learning applications. Unfortunately, an embedding of $n$ points is specified by $n^3$ triplets, making collecting every triplet an expensive task. In noticing this difficulty, other researchers have investigated more intelligent triplet sampling techniques, but they do not study their effectiveness or their potential drawbacks. Although it is important to reduce the number of collected triplets, it is also important to understand how best to display a triplet collection task to a user. In this work we explore an alternative display for collecting triplets and analyze the monetary cost and speed of the display. We propose best practices for creating cost effective human intelligence tasks for collecting triplets. We show that rather than changing the sampling algorithm, simple changes to the crowdsourcing UI can lead to much higher quality embeddings. We also provide a dataset as well as the labels collected from crowd workers.
研究动机与目标
- 解决通过传统MTurk UI逐个收集三元组相似性比较所导致的高成本与低效率问题。
- 探究批量处理、基于网格的UI是否能在降低金钱与时间成本的同时,提升感知嵌入的质量。
- 建立设计成本效益高、质量优的人工智力任务(HIT)的实践准则,用于收集相似性比较数据。
- 在真实众包环境中评估网格尺寸、工作者投入与嵌入性能之间的权衡。
提出的方法
- 设计一种网格用户界面,将一个查询图像与n个图像并列显示,工作者从中选择k个最相似的图像,每屏生成k(n−k)个三元组。
- 采用16选4的网格布局,以在保持较低工作者负担的前提下最大化三元组产出量(每屏48个)。
- 使用该网格界面收集人工标注的三元组数据,并设置20%的陷阱试验以确保数据质量。
- 利用标准度量学习算法,对比不同网格尺寸(如4选2、8选4、12选4、16选4)下的嵌入质量。
- 监控工作者的耗时与收入,以确保薪酬公道并提升工作满意度。
- 与自适应采样策略(如CKL)进行基准对比,使用合成数据与人工标注数据进行评估。
实验结果
研究问题
- RQ1基于网格的HIT界面是否能产生比传统逐个三元组比较界面更高质量的感知嵌入?
- RQ2每屏收集的三元组数量如何影响嵌入质量与成本效率?
- RQ3在最大化工作者满意度与成本效率的前提下,网格尺寸(n)与选择项目数(k)之间应如何权衡以达到最优?
- RQ4在嵌入质量与成本方面,基于网格的批量三元组收集是否能优于自适应采样算法(如CKL)?
- RQ5陷阱试验在多大程度上可确保数据质量,而无需依赖事后过滤?
主要发现
- 16选4的网格布局(每屏产出48个三元组)产生了最高质量的感知嵌入,且优于所有其他网格配置。
- 尽管单个三元组可能捕捉的信息较少,基于网格的收集方法仍实现了比逐个三元组比较更高的嵌入质量。
- 工作者平均在10秒内完成最大网格(16选4)任务,最快者每项任务耗时不足2.1秒,完成800项任务仅用时约2.1秒/项。
- 以每项HIT 0.10美元的计价标准,工作者的中位时薪超过10美元,最快者时薪超过17美元。
- 该方法无需数据过滤或资格筛选,因为陷阱试验(占响应的20%)已证实数据质量极高。
- 尽管CKL算法在理论上具有信息增益优化优势,基于网格的方法在嵌入质量与成本效率方面仍优于自适应CKL采样策略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。