Skip to main content
QUICK REVIEW

[论文解读] Universal Clustering via Crowdsourcing

Ravi Kiran Raman, Lav R. Varshney|arXiv (Cornell University)|Oct 5, 2016
Mobile Crowdsensing and Crowdsourcing参考文献 21被引用 3
一句话总结

本文提出了一种适用于众包数据的通用聚类框架,无需事先了解工作者的可靠性或任务难度。通过建模工作者响应中的记忆特性和距离特性,该框架为临时工作者和长期工作者设计了渐近一致的聚类算法,证明了样本复杂度的顺序最优性,并在无监督学习设置下建立了成本效率的理论边界。

ABSTRACT

Consider unsupervised clustering of objects drawn from a discrete set, through the use of human intelligence available in crowdsourcing platforms. This paper defines and studies the problem of universal clustering using responses of crowd workers, without knowledge of worker reliability or task difficulty. We model stochastic worker response distributions by incorporating traits of memory for similar objects and traits of distance among differing objects. We are particularly interested in two limiting worker types---temporary workers who retain no memory of responses and long-term workers with memory. We first define clustering algorithms for these limiting cases and then integrate them into an algorithm for the unified worker model. We prove asymptotic consistency of the algorithms and establish sufficient conditions on the sample complexity of the algorithm. Converse arguments establish necessary conditions on sample complexity, proving that the defined algorithms are asymptotically order-optimal in cost.

研究动机与目标

  • 解决在未知工作者可靠性与任务难度的情况下,众包中无监督聚类的挑战。
  • 建模工作者响应中的人类决策特性,如记忆效应和对象间的感知距离。
  • 设计适用于不同工作者类型(临时与长期)的通用聚类算法,且无需事先了解通道信息。
  • 在通用设置下,建立聚类性能的渐近一致性和样本复杂度边界。
  • 证明所提出的算法在样本复杂度方面达到顺序最优,且可通过反向论证加以验证。

提出的方法

  • 使用统一框架对工作者响应进行建模,整合记忆效应与对象间距离,包含两种极限情形:临时工作者(i.i.d. 响应)与长期工作者(跨任务的马尔可夫记忆)。
  • 采用马尔可夫记忆模型,其中当前响应依赖于最近一次响应以及对同一对象类别的先前响应。
  • 基于最小划分信息泛函和经验熵估计定义聚类算法,以实现通用聚类。
  • 应用最大似然估计进行熵和互信息估计,以在有限字母表假设下确保渐近一致性。
  • 利用集中不等式和总变差界推导经验熵与互信息的收敛速率。
  • 通过建立假设分布之间的KL散度边界,证明聚类间分离度恒定,且与序列长度无关。

实验结果

研究问题

  • RQ1是否可以在不了解工作者可靠性或任务难度的前提下,可靠地进行众包聚类?
  • RQ2记忆效应与对象间的感知距离如何影响通用聚类算法的设计?
  • RQ3在通用设置下,实现渐近一致聚类所需的最小样本复杂度是多少?
  • RQ4所提出的算法在样本复杂度方面是否达到顺序最优,且能否通过反向论证加以证明?
  • RQ5临时工作者(无记忆)与长期工作者(有记忆)在聚类性能与成本效率方面有何差异?

主要发现

  • 所提出的聚类算法具有渐近一致性,随着样本量增加,经验熵与互信息估计值收敛至真实值。
  • 可靠聚类的样本复杂度下界为 $ \frac{|\mathcal{X}|}{\epsilon \log |\mathcal{X}|} $,与已知的熵估计下界一致。
  • 通过反向论证确认,算法实现了样本复杂度的顺序最优性,下界与上界仅相差常数因子。
  • 对于有限且恒定的字母表大小,经验熵的收敛速率满足 $ \Pr[|\hat{H}(X)-H(X)|>\epsilon] \leq 2\exp\left(\frac{-n\epsilon^2}{2\log^2 n}+o(1)\right) $。
  • 任意两个假设分布之间的KL散度始终被一个与序列长度无关的常数所限制,确保聚类分离的稳定性。
  • 该框架支持对临时工作者与长期工作者群体的理论比较,量化了众包聚类中成本与可靠性之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。