Skip to main content
QUICK REVIEW

[论文解读] RDF-Hunter: Automatically Crowdsourcing the Execution of Queries Against RDF Data Sets

Maribel Acosta, Elena Simperl|arXiv (Cornell University)|Mar 10, 2015
Mobile Crowdsensing and Crowdsourcing参考文献 10被引用 5
一句话总结

RDF-Hunter 是一种混合 SPARQL 查询引擎,通过自动识别并将可能因缺少 RDF 数据值而导致结果不完整的查询部分外包给众包处理,利用微任务众包来提升答案的完整性。它通过基于质量模型动态将子查询路由至众包,该模型评估众包的置信度和熟悉度,从而实现高准确率(F-measure 0.84–0.96)。

ABSTRACT

In the last years, a large number of RDF data sets has become available on the Web. However, due to the semi-structured nature of RDF data, missing values affect answer completeness of queries that are posed against this data. To overcome this limitation, we propose RDF-Hunter, a novel hybrid query processing approach that brings together machine and human computation to execute queries against RDF data. We develop a novel quality model and query engine in order to enable RDF-Hunter to on the fly decide which parts of a query should be executed through conventional technology or crowd computing. To evaluate RDF-Hunter, we created a collection of 50 SPARQL queries against the DBpedia data set, executed them using our hybrid query engine, and analyzed the accuracy of the outcomes obtained from the crowd. The experiments clearly show that the overall approach is feasible and produces query results that reliably and significantly enhance completeness of automatic query processing responses.

研究动机与目标

  • 解决由于链接开放数据中缺少值而导致 RDF 数据集中查询结果不完整的问题。
  • 设计一种系统,自动决定 SPARQL 查询的哪些部分应通过人机计算执行以提升完整性。
  • 开发一种质量模型,用于估计 RDF 数据的完整性并指导混合查询执行。
  • 评估在真实世界 RDF 工作负载中人机混合查询处理的可行性和有效性。
  • 创建一个针对 DBpedia 的 50 个 SPARQL 查询基准,以评估众包结果的完整性和准确性。

提出的方法

  • 该系统使用一种质量模型,结合工作者置信度和主题熟悉度,以估计众包答案的可靠性。
  • 基于 RDF 数据的质量和结构分析,执行动态查询分解,以隔离可能因缺少值而受影响的子查询。
  • 查询引擎整合来自自动化 SPARQL 端点和众包微任务的结果,使用隶属度(m)对众包答案进行加权。
  • 通过 CrowdFlower 平台生成众包任务,并设置熟悉度和置信度问题以评估工作者的专业水平。
  • 系统采用物理查询优化器,基于估计的完整性、成本和准确性选择最优执行策略。
  • 采用基于热力图的评估方法,分析五个知识领域(生命科学、历史、音乐、体育、电影)中的召回率和精确率。

实验结果

研究问题

  • RQ1混合系统能否自动识别 SPARQL 查询中受 RDF 数据集中缺失数据影响的部分?
  • RQ2微任务众包在提升真实世界 RDF 数据中 SPARQL 查询答案完整性方面有多有效?
  • RQ3哪些质量度量指标(如置信度和熟悉度)能够可靠地指导子查询向人机计算的路由?
  • RQ4该系统的动态查询分解在不依赖 SPARQL 扩展的情况下,能在多大程度上提升答案完整性?
  • RQ5在不同知识领域中,众包结果的精确率和召回率如何比较?

主要发现

  • RDF-Hunter 在全部 50 个基准查询中实现了 0.84 至 0.96 的 F-measure,表明其在混合查询处理中具有高准确率。
  • 在 50 个查询中的 41 个,众包实现了完美的召回率(1.0),表明其在恢复缺失值方面能力出色。
  • 在 21 个查询中,精确率和召回率均达到 1.0,表明在超过 40% 的情况下,众包提供了完全正确的答案。
  • 众包的平均置信度较高(0.92–0.95),标准差约为 0.07,表明在各领域中均表现出一致的可靠性。
  • 熟悉度得分显示,体育和电影领域最为熟悉,而生命科学领域熟悉度较低,影响了众包答案的隶属度(m)。
  • 该系统成功避免了对低专业水平谓词(如音乐查询 2 和电影查询 4)的重复众包,展示了智能的任务路由能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。