Skip to main content
QUICK REVIEW

[论文解读] Reducing Uncertainty of Schema Matching via Crowdsourcing with Accuracy Rates

Chen Zhang, Lei Chen|arXiv (Cornell University)|Sep 11, 2018
Mobile Crowdsensing and Crowdsourcing被引用 6
一句话总结

本文提出了两种自适应众包框架——Single CCQ 和 Multiple CCQ——通过根据工作者准确率动态选择并发布对应正确性问题(CCQ),以减少模式匹配中的不确定性。该方法将不确定性减少建模为熵增益,并提供了具有理论界保证的高效算法,在预算约束下实现了显著的不确定性降低。

ABSTRACT

Schema matching is a central challenge for data integration systems. Inspired by the popularity and the success of crowdsourcing platforms, we explore the use of crowdsourcing to reduce the uncertainty of schema matching. Since crowdsourcing platforms are most effective for simple questions, we assume that each Correspondence Correctness Question (CCQ) asks the crowd to decide whether a given correspondence should exist in the correct matching. Furthermore, members of a crowd may sometimes return incorrect answers with different probabilities. Accuracy rates of individual crowd workers are probabilities of returning correct answers which can be attributes of CCQs as well as evaluations of individual workers. We prove that uncertainty reduction equals to entropy of answers minus entropy of crowds and show how to obtain lower and upper bounds for it. We propose frameworks and efficient algorithms to dynamically manage the CCQs to maximize the uncertainty reduction within a limited budget of questions. We develop two novel approaches, namely `Single CCQ' and `Multiple CCQ', which adaptively select, publish and manage questions. We verify the value of our solutions with simulation and real implementation.

研究动机与目标

  • 解决半自动模式匹配工具中固有的不确定性问题,这些工具会产生多个可能的匹配及其对应概率。
  • 克服在临时数据集成场景中依赖非专家用户解决模糊性问题的局限性。
  • 利用 Amazon Mechanical Turk 等众包平台,通过人类对细粒度对应正确性的判断来提高匹配准确性。
  • 在固定预算下,优化成本(CCQ 数量)与性能(不确定性减少)之间的权衡。
  • 将工作者准确率建模为概率属性,以考虑众包贡献者可靠性差异。

提出的方法

  • 将对应正确性问题(CCQ)定义为二元查询,询问特定属性对应是否正确。
  • 将不确定性减少建模为答案熵与群体响应熵之间的差值,并证明该差值等于预期不确定性减少量。
  • 将 CCQ 选择问题表述为最大化预期不确定性减少,利用子模性设计 (1+ε)-近似算法。
  • 提出两种框架:Single CCQ(每次迭代选择一个最优 CCQ)和 Multiple CCQ(每次迭代选择一组 k 个 CCQ),基于动态反馈。
  • 将工作者准确率作为先验概率,以加权答案的可靠性,并迭代地改进不确定性估计。
  • 推导出不确定性减少的理论下界和上界,从而在选择过程中实现性能保证。

实验结果

研究问题

  • RQ1当自动化工具无法解决模糊性时,如何有效利用众包来减少模式匹配中的不确定性?
  • RQ2选择 CCQ 的最优策略是什么,以在最小化提问数量的同时最大化不确定性减少?
  • RQ3工作者准确率如何影响众包答案的可靠性以及整体不确定性减少过程?
  • RQ4不确定性减少能否被形式化界定?通过众包实现的改进理论极限是什么?
  • RQ5在预算和时间约束下,如何优化一次性选择多个 CCQ 的过程,同时考虑可变的回答率和工作者可靠性?

主要发现

  • 不确定性减少在数学上等价于答案熵与群体响应熵之间的差值,为方法提供了坚实的理论基础。
  • CCQ 选择问题是 NP-难问题,但基于不确定性减少函数的子模性,提出了 (1+ε)-近似算法。
  • Multiple CCQ 框架在每次提问的不确定性减少方面优于 Single CCQ,尤其是在显式建模工作者准确率时。
  • 推导出了不确定性减少的理论界,使不同策略之间的性能评估与比较成为可能。
  • 仿真与真实世界实现均表明,所提出的框架在有限预算下显著降低了不确定性,优于基线方法。
  • 工作者准确率对于可靠的不确定性估计至关重要,必须作为 CCQ 选择过程的一部分进行建模,以避免低质量响应带来的偏差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。