Skip to main content
QUICK REVIEW

[論文レビュー] Digging Deeper into Deep Web Databases by Breaking Through the Top-k Barrier

Saravanan Thirumuruganathan, Nan Zhang|arXiv (Cornell University)|Aug 19, 2012
Data Management and Algorithms参考文献 20被引用数 4
ひとこと要約

本稿では、ランク付け関数を事前に知らなくても、公開のtop-kインターフェースのみを用いて、隠しWebデータベースから(h+1)番目にランク付けされたタプルを取得するメタアルゴリズムGetNextを提案する。繰り返しのリフォーミュレーションクエリの生成と、結果の分析による候補のテストを通じて、GetNextはk個を超えるタプルにアクセス可能にし、top-kの壁を打ち破る。実証実験では、Amazonのレート制限(1時間あたり2000クエリ)をはるかに下回る500クエリ未満で、250件のAmazon DVDタイトルを取得できた。

ABSTRACT

A large number of web databases are only accessible through proprietary form-like interfaces which require users to query the system by entering desired values for a few attributes. A key restriction enforced by such an interface is the top-k output constraint - i.e., when there are a large number of matching tuples, only a few (top-k) of them are preferentially selected and returned by the website, often according to a proprietary ranking function. Since most web database owners set k to be a small value, the top-k output constraint prevents many interesting third-party (e.g., mashup) services from being developed over real-world web databases. In this paper we consider the novel problem of "digging deeper" into such web databases. Our main contribution is the meta-algorithm GetNext that can retrieve the next ranked tuple from the hidden web database using only the restrictive interface of a web database without any prior knowledge of its ranking function. This algorithm can then be called iteratively to retrieve as many top ranked tuples as necessary. We develop principled and efficient algorithms that are based on generating and executing multiple reformulated queries and inferring the next ranked tuple from their returned results. We provide theoretical analysis of our algorithms, as well as extensive experimental results over synthetic and real-world databases that illustrate the effectiveness of our techniques.

研究の動機と目的

  • トップ-kのWebデータベースインターフェースが、数個のランク付け済み結果に制限されることによる制限を解消し、マッシュアップやデータ分析などのサードパーティアプリケーションの実現を支援すること。
  • データベース所有者の非公開アクセスや協力なしに、隠しWebデータベースからk個を超えるトップランクタプルを取得できることを実現すること。
  • プライベートアクセスを必要とせず、公開クエリインターフェースのみを用いても動作する自動的かつスケーラブルなソリューションを構築すること。
  • 隠しデータベースにおけるランク付け関数が不明であるという課題を、クエリ結果の分析によってタプルの順序を推定することで克服すること。

提案手法

  • トップ-k結果を超える次の上位タプルを特定するための2段階プロセス(候補生成と候補テスト)を提案する。
  • 属性値を変更することで複数のリフォーミュレーションクエリを生成し、データベースインターフェースをプローブして結果セットを収集する。
  • 結果セットの重複と包含パターンに基づき、未収集のタプルよりも高いランクである可能性があるかどうかを判断する候補テストフェーズを採用する。
  • クエリ選別性の低さにより完全な順序付けが不可能な状況に対処するため、部分順序推定機構を採用する。
  • 頻度が低い最小アイテムセット抽出の原則を応用し、top-kを超える可能性のある候補タプルを効率的に同定する。
  • クエリコストと取得効率を最適化するORDERED-GETNEXTおよびBEYOND-h-GETNEXTアルゴリズムを実装する。

実験結果

リサーチクエスチョン

  • RQ1ランク付け関数を事前に知らなくても、公開インターフェースのみを用いて、隠しWebデータベースのtop-kを超えるタプルを取得可能か?
  • RQ2ランク付け関数が不明な状況で、(h+1)番目にランク付けされたタプルを信頼性高く特定するために必要な最小クエリ数は何か?
  • RQ3拡張top-h結果セットへの組み込みを目的とした、候補タプルの体系的生成とテストの方法をどのように設計できるか?
  • RQ4クエリ選別性が、取得プロセスの性能と完全性に与える影響はどの程度か?
  • RQ5レート制限や制限付きクエリアクセスがある実世界のデータベースに対しても、提案手法はスケーラブルか?

主な発見

  • GetNextアルゴリズムは、Amazonのデフォルトのtop-100を超えるトップ250件のAmazon DVDタイトルを、500クエリ未満で取得でき、Amazonの1時間あたり2000クエリのレート制限を大幅に下回った。
  • 真のランク順序を推定する精度が高く、クエリ選別性が低いほどケンダール-τ相関が向上し、選別性が低いクエリでより優れた性能を示した。
  • 候補テストフェーズが結果セットの重複を活用することで、誤検出を顕著に低減し、取得精度を著しく向上させた。
  • 効率的なスケーラビリティを実現:クエリ選別性が低くなると、候補テストフェーズでの早期終了が生じ、必要なクエリ数が減少した。
  • ORDERED-GETNEXTは、特にhやkが大きい場合にBEYOND-h-GETNEXTを上回るクエリ効率を示し、多様なワークロードにわたって堅牢であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。