Skip to main content
QUICK REVIEW

[論文レビュー] RDF-Hunter: Automatically Crowdsourcing the Execution of Queries Against RDF Data Sets

Maribel Acosta, Elena Simperl|arXiv (Cornell University)|Mar 10, 2015
Mobile Crowdsensing and Crowdsourcing参考文献 10被引用数 5
ひとこと要約

RDF-Hunter は、欠落している RDF データ値のための結果が不完全になる可能性があるクエリの部分を自動で特定し、マイクロタスク型のクラウドソーシングを用いて回答の完全性を向上させるハイブリッド SPARQL クエリエンジンです。品質モデルを用いてクラウドの信頼性と熟練度を評価することで、動的にサブクエリをクラウドソーシングにルーティングし、高い正確性(F-measure 0.84–0.96)を達成しています。

ABSTRACT

In the last years, a large number of RDF data sets has become available on the Web. However, due to the semi-structured nature of RDF data, missing values affect answer completeness of queries that are posed against this data. To overcome this limitation, we propose RDF-Hunter, a novel hybrid query processing approach that brings together machine and human computation to execute queries against RDF data. We develop a novel quality model and query engine in order to enable RDF-Hunter to on the fly decide which parts of a query should be executed through conventional technology or crowd computing. To evaluate RDF-Hunter, we created a collection of 50 SPARQL queries against the DBpedia data set, executed them using our hybrid query engine, and analyzed the accuracy of the outcomes obtained from the crowd. The experiments clearly show that the overall approach is feasible and produces query results that reliably and significantly enhance completeness of automatic query processing responses.

研究の動機と目的

  • リンクドオープンデータにおける欠落した値のため、RDF データセットでクエリの答えが不完全になる問題に対処すること。
  • クエリのどの部分を人間による計算で実行すべきかを自動で決定するシステムを設計すること。
  • RDF データの完全性を推定し、ハイブリッドクエリ実行をガイドする品質モデルを開発すること。
  • 実世界の RDF ワークロードにおける人間とコンピュータのハイブリッドクエリ処理の実現可能性と有効性を評価すること。
  • DBpedia を対象に 50 個の SPARQL クエリからなるベンチマークを構築し、クラウドソーシングによる結果の完全性と正確性を評価すること。

提案手法

  • 作業者の信頼性とトピックの熟練度を組み合わせた品質モデルを用いて、クラウドソーシングによる回答の信頼性を推定する。
  • RDF データの品質と構造的分析に基づき、欠落値の影響を受けやすいサブクエリを特定する動的クエリ分解を実施する。
  • 自動化された SPARQL エンドポイントとクラウドソーシングによるマイクロタスクの結果を統合し、参加者の所属度(m)を重みとしてクラウド回答を処理する。
  • CrowdFlower プラットフォームを介してマイクロタスクを生成し、作業者の熟練度と信頼性を評価するための質問を設ける。
  • 推定された完全性、コスト、正確性に基づき、最適な実行戦略を選択する物理的クエリプランナを採用する。
  • 5 つの知識分野(ライフサイエンス、歴史、音楽、スポーツ、映画)における再現率と正確率の分析のために、ヒートマップベースの評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドシステムは、RDF データセットにおける欠落データの影響を受けるクエリの部分を自動で特定できるか?
  • RQ2マイクロタスク型クラウドソーシングは、実世界の RDF データに対して SPARQL クエリの回答の完全性を向上させるのにどの程度有効か?
  • RQ3信頼性や熟練度といった品質指標は、サブクエリを人間による計算にルーティングするのに信頼性を持って使えるか?
  • RQ4動的クエリ分解により、SPARQL 拡張子を必要とせずに答えの完全性をどの程度向上できるか?
  • RQ5多様な知識分野において、クラウドソーシングによる結果の正確率と再現率はどのように比較されるか?

主な発見

  • RDF-Hunter は、すべての 50 個のベンチマーククエリで F-measure 0.84~0.96 を達成し、ハイブリッドクエリ処理における高い正確性を示した。
  • クラウドは 50 個のクエリのうち 41 個で完全な再現率(1.0)を達成し、欠落した値を効果的に回復できる能力を示した。
  • 21 個のクエリで正確率と再現率がともに 1.0 に達し、40% を超えるケースでクラウドが完全に正しい回答を提供した。
  • 平均的なクラウドの信頼性は高く(0.92~0.95)、標準偏差は約 0.07 であり、分野をまたいで一貫した信頼性が確認された。
  • 熟練度スコアから、スポーツと映画が最も熟練度の高い分野であり、ライフサイエンスは熟練度が低く、クラウド回答の所属度(m)に影響を与えた。
  • システムは、音楽クエリ 2 や映画クエリ 4 のような熟練度が低い述語について、再びクラウドに送信するのを回避し、知的なタスクルーティングを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。