Skip to main content
QUICK REVIEW

[论文解读] Getting It All from the Crowd

Beth Trushkowsky, Tim Kraska|arXiv (Cornell University)|Feb 10, 2012
Mobile Crowdsensing and Crowdsourcing参考文献 28被引用 8
一句话总结

本文提出基于物种估计的统计方法,以解决众包数据库系统中查询完整性的问题,其中传统的封闭世界假设不再适用。通过将众包数据收集建模为物种估计问题,作者开发了工具来估计查询完整性,并指导成本-时间权衡,使用户能够判断何时已从众包中‘获取全部’信息。

ABSTRACT

Hybrid human/computer systems promise to greatly expand the usefulness of query processing by incorporating the crowd for data gathering and other tasks. Such systems raise many database system implementation questions. Perhaps most fundamental is that the closed world assumption underlying relational query semantics does not hold in such systems. As a consequence the meaning of even simple queries can be called into question. Furthermore query progress monitoring becomes difficult due to non-uniformities in the arrival of crowdsourced data and peculiarities of how people work in crowdsourcing systems. To address these issues, we develop statistical tools that enable users and systems developers to reason about tradeoffs between time/cost and completeness. These tools can also help drive query execution and crowdsourcing strategies. We evaluate our techniques using experiments on a popular crowdsourcing platform.

研究动机与目标

  • 解决混合人机数据库系统中查询语义的根本挑战,其中封闭世界假设不再适用。
  • 使用户和系统开发者能够推理众包数据收集中查询成本、执行时间与完整性之间的权衡。
  • 提供统计工具,支持开放世界环境中查询执行与众包策略决策。
  • 提高在结果无界且可能不完整系统中枚举查询(如 SELECT * 或 COUNT(*))的可靠性。

提出的方法

  • 将原本用于生态学和统计学的非参数物种估计技术适配用于估计众包关系中唯一元组的总数。
  • 应用 Chao1 和 Chao2 等标准估计器,基于众包数据中已观测到的项目频率,估计未观测到的项目数量。
  • 提出两种新颖启发式方法:一种用于校正‘连环提交者’(即提交大量重复或无效响应的工作者),另一种用于检测‘列表遍历’行为(即工作者系统性地向现有列表中添加项目)。
  • 利用估计的完整性来指导查询执行,例如确定何时停止发布新任务或调整众包策略。
  • 采用混合用户界面,结合标准输入与‘负向建议’模式,即工作者只能提交尚未存在于列表中的新答案,以提升数据质量和覆盖范围。
  • 通过在 Amazon Mechanical Turk 上的实验验证该方法,证明其在多种查询类型中估计完整性的有效性。

实验结果

研究问题

  • RQ1在结果集可能无界的众包数据库系统中,能否对枚举查询有意义地定义‘完整性’?
  • RQ2当真实基数未知且数据以非均匀、随机方式到达时,如何估计唯一结果总数(例如所有美国州或所有求职市场中的博士生)?
  • RQ3在部分采样的前提下,可使用哪些统计技术来估计已从众包中收集到所有相关结果的可能性?
  • RQ4工作者行为如列表遍历或连环提交如何影响完整性估计的准确性,以及如何缓解这些问题?
  • RQ5统计估计工具在多大程度上可指导成本效益高且高效的众包策略用于查询处理?

主要发现

  • Chao1 和 Chao2 等标准物种估计技术即使在采样有限的情况下,也能对众包结果集中唯一项目的总数提供出人意料的稳健估计。
  • ‘连环提交者’(即提交大量重复或无效响应的工作者)的存在会显著降低标准估计器的准确性,但所提出的校正启发式方法显著提升了估计质量。
  • 检测到‘列表遍历’行为(即工作者遵循预设列表而非探索新项目)可实现对众包策略的主动调整,例如切换至负向建议界面。
  • 负向建议用户界面(防止工作者提交已列出的项目)在扩展集合和发现稀有或此前未见的项目方面被证明是有效的。
  • 将统计完整性估计集成到查询执行中,可实现基于数据的决策,以确定何时终止数据收集,从而在成本与完整性之间取得平衡。
  • 所提出的方法具有可扩展性,不仅适用于 CrowdDB,还可应用于其他混合人机数据库系统,如 Qurk 和 sCOOP。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。