Skip to main content
QUICK REVIEW

[論文レビュー] Getting It All from the Crowd

Beth Trushkowsky, Tim Kraska|arXiv (Cornell University)|Feb 10, 2012
Mobile Crowdsensing and Crowdsourcing参考文献 28被引用数 8
ひとこと要約

本稿では、従来のクローズドワールド仮定が成り立たないクラウドソーシングデータベースシステムにおけるクエリの完全性の課題に対処するため、種の推定に基づく統計的手法を提案する。クラウドソーシングによるデータ収集を種の推定問題としてモデル化することで、著者たちはクエリの完全性を推定し、コストと時間のトレードオフを最適化するツールを開発し、ユーザーが「すべての情報を得た」と判断できるタイミングを推論可能にする。

ABSTRACT

Hybrid human/computer systems promise to greatly expand the usefulness of query processing by incorporating the crowd for data gathering and other tasks. Such systems raise many database system implementation questions. Perhaps most fundamental is that the closed world assumption underlying relational query semantics does not hold in such systems. As a consequence the meaning of even simple queries can be called into question. Furthermore query progress monitoring becomes difficult due to non-uniformities in the arrival of crowdsourced data and peculiarities of how people work in crowdsourcing systems. To address these issues, we develop statistical tools that enable users and systems developers to reason about tradeoffs between time/cost and completeness. These tools can also help drive query execution and crowdsourcing strategies. We evaluate our techniques using experiments on a popular crowdsourcing platform.

研究の動機と目的

  • 閉じた世界仮定が成立しなくなったハイブリッド人間-コンピュータデータベースシステムにおけるクエリ意味論の根本的課題に取り組むこと。
  • クラウドソーシングによるデータ収集において、クエリコスト、実行時間、完全性のトレードオフをユーザーおよびシステム開発者が推論できるようにすること。
  • オープンワールド環境におけるクエリ実行およびクラウドソーシング戦略意思決定を支援する統計的ツールを提供すること。
  • 結果が境界なしで不完全な可能性があるシステムにおける列挙クエリ(例:SELECT * や COUNT(*))の信頼性を向上させること。

提案手法

  • 生態学および統計学で元来用いられる非パラメトリックな種の推定技術を、クラウドソーシングされた関係における一意なタプル総数を推定するために適応する。
  • Chao1 や Chao2 といった標準的推定器を用い、クラウドソーシングデータにおける観測済みアイテムの頻度に基づいて未観測アイテム数を推定する。
  • 2つの新規ヒューリスティクスを導入:1つは「ストリークス(多くの重複または無効な応答を提出する作業者)」を補正するもので、もう1つは「リストウォーク(既存のリストに順次アイテムを追加する行動)」を検出するものである。
  • 推定された完全性を基にクエリ実行を最適化し、たとえば新しいタスクの発行を停止するタイミングや、クラウドソーシング戦略の再調整を決定する。
  • 標準入力と「ネガティブサジェストモード」を組み合わせたハイブリッドユーザーインターフェースを採用し、作業者がリストにすでに存在する項目以外をのみ提出できるようにすることで、データ品質とカバレッジを向上させる。
  • アマゾン・メカニカル・トルクを用いた実験により、多様なクエリタイプにおいて完全性推定の有効性を検証した。

実験結果

リサーチクエスチョン

  • RQ1結果集合が無限に拡張可能であるクラウドソーシングデータベースシステムにおいて、列挙クエリに対して「完全性」を意味的に定義可能か?
  • RQ2真の基数が不明で、非一様かつ確率的な方法でデータが到着する状況下で、全ユニークな結果(例:米国の州、就職市場における博士課程学生)の総数を推定するにはどのような統計的手法が有効か?
  • RQ3部分的なサンプリングが行われた状況下で、クラウドからすべての関連結果を収集できた確率を推定するのに適した統計的手法は何か?
  • RQ4リストウォークやストリークスといった作業者の行動が、完全性推定の正確性に与える影響は何か? また、それらをどのように軽減できるか?
  • RQ5統計的推定ツールは、クエリ処理におけるコスト効率的かつ効果的なクラウドソーシング戦略をどの程度まで支援できるか?

主な発見

  • Chao1 や Chao2 といった標準的種の推定技術は、サンプリングが限られている状況下でも、クラウドソーシングされた結果集合における一意なアイテム総数を驚くほど頑健に推定できる。
  • 多くの重複または無効な応答を提出する「ストリークス」の存在は、標準的推定器の正確性を著しく低下させるが、提案された補正ヒューリスティクスにより推定品質が向上する。
  • 「リストウォーク」行動(作業者が事前に存在するリストに従ってアイテムを順次追加する行動)の検出により、ネガティブサジェストインターフェースへの切り替えといった、事前のクラウドソーシング戦略の調整が可能になる。
  • ネガティブサジェストユーザーインターフェース(すでにリストに存在する項目の提出を禁止)は、セットの拡大および希少または未発見のアイテムの発見に有効であることが示された。
  • 統計的完全性推定をクエリ実行に統合することで、コストと完全性のバランスを最適化したデータ収集の終了タイミングをデータドリブンに決定できるようになった。
  • 提案手法は CrowdDB に限らず、Qurk や sCOOP のような他のハイブリッド人間-マシンデータベースシステムに対しても一般化可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。