[论文解读] The Expected Optimal Labeling Order Problem for Crowdsourced Joins and Entity Resolution
本文修正了作者在2013年SIGMOD论文中关于众包实体解析的缺陷,其中他们错误地声称其期望最优标注顺序(EOLO)算法具有最优性。他们发现EOLO问题为NP难问题,修正了原有方法,并承认Vesdapunt等人正确指出了该问题的复杂性并提出了更优的算法,尽管原始框架与实验结果在修正最优性声明后依然有效。
In the SIGMOD 2013 conference, we published a paper extending our earlier work on crowdsourced entity resolution to improve crowdsourced join processing by exploiting transitive relationships [Wang et al. 2013]. The VLDB 2014 conference has a paper that follows up on our previous work [Vesdapunt et al., 2014], which points out and corrects a mistake we made in our SIGMOD paper. Specifically, in Section 4.2 of our SIGMOD paper, we defined the "Expected Optimal Labeling Order" (EOLO) problem, and proposed an algorithm for solving it. We incorrectly claimed that our algorithm is optimal. In their paper, Vesdapunt et al. show that the problem is actually NP-Hard, and based on that observation, propose a new algorithm to solve it. In this note, we would like to put the Vesdapunt et al. results in context, something we believe that their paper does not adequately do.
研究动机与目标
- 修正作者在2013年SIGMOD论文中关于众包实体解析的错误最优性声明。
- 阐明在传递性推理假设下,期望最优标注顺序(EOLO)问题为NP难问题。
- 通过移除EOLO算法最优性的错误声明,更新原始框架。
- 阐明Vesdapunt等人所作贡献的背景,他们识别并纠正了EOLO证明中的错误。
- 确保原始框架与实验结果的完整性,尽管EOLO组件已修正,但其仍保持有效。
提出的方法
- 使用修正后的传递一致性模型,重新评估EOLO问题中预期众包配对数的概率计算。
- 发现原始最优性证明失败的原因在于概率空间中包含了不可能的情形。
- 基于五种等可能的一致标签配置,将第三对(b,c)的错误概率计算从0.25更正为0.4。
- 修改SIGMOD 2013年论文第4.2节中的示例,以反映正确的期望值2.4,而非原先的2.25。
- 更新SIGMOD 2013年论文的arXiv版本,移除最优性声明,并引用Vesdapunt等人于2014年在VLDB发表的论文。
- 保留原始框架与实验结果,其不受EOLO组件修正的影响。
实验结果
研究问题
- RQ1如原始声明所述,期望最优标注顺序(EOLO)问题是否可在多项式时间内求解?
- RQ2在使用传递关系推断标签时,正确的众包配对数的期望值是多少?
- RQ3为何原始EOLO算法最优性证明失败?
- RQ4EOLO问题的NP难性如何影响原始框架的有效性?
- RQ5在修正EOLO声明后,原始论文的实验结果在多大程度上仍保持有效?
主要发现
- 原始声明称EOLO算法具有最优性,该说法错误,原因在于证明中使用了错误的概率空间。
- 由于第三对(b,c)的概率计算错误,三对示例中正确的众包配对数期望值为2.4,而非2.25。
- 如Vesdapunt等人所证明,在原始工作中采用的传递性假设下,EOLO问题为NP难问题。
- 修正分析表明,由于排除了不一致的标签配置,第三对(b,c)被众包标注的概率为0.4,而非0.25。
- 原始框架与实验结果依然正确,且不受EOLO组件修正的影响。
- Vesdapunt等人于2014年在VLDB发表的论文提供了有效且改进的EOLO算法,但其声称的实践性能提升一个数量级,并未得到实验数据的支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。