Skip to main content
QUICK REVIEW

[論文レビュー] Diversification Based Static Index Pruning - Application to Temporal Collections

Zeynep Pehlivan, Benjamin Piwowarski|arXiv (Cornell University)|Aug 22, 2013
Advanced Image and Video Retrieval Techniques参考文献 26被引用数 3
ひとこと要約

本稿では、時間的多様性を保ちながらウェブアーカイブコレクションのインデックスサイズを削減する、多様性に基づく静的インデックス刈り込み手法を提案する。各語のトップ-kポスティングを、DCGを最大化するための貪欲アルゴリズムを用いて選択し、時間に敏感な分布を考慮する。実験の結果、特に時間的クエリにおいて、多様性を無視する刈り込み手法を上回る性能を示し、Simpleおよびスライディングウィンドウ戦略が優れた検索効果を達成した。

ABSTRACT

Nowadays, web archives preserve the history of large portions of the web. As medias are shifting from printed to digital editions, accessing these huge information sources is drawing increasingly more attention from national and international institutions, as well as from the research community. These collections are intrinsically big, leading to index files that do not fit into the memory and an increase query response time. Decreasing the index size is a direct way to decrease this query response time. Static index pruning methods reduce the size of indexes by removing a part of the postings. In the context of web archives, it is necessary to remove postings while preserving the temporal diversity of the archive. None of the existing pruning approaches take (temporal) diversification into account. In this paper, we propose a diversification-based static index pruning method. It differs from the existing pruning approaches by integrating diversification within the pruning context. We aim at pruning the index while preserving retrieval effectiveness and diversity by pruning while maximizing a given IR evaluation metric like DCG. We show how to apply this approach in the context of web archives. Finally, we show on two collections that search effectiveness in temporal collections after pruning can be improved using our approach rather than diversity oblivious approaches.

研究の動機と目的

  • 大規模なインデックスサイズがクエリ応答時間を低下させるという時間的ウェブアーカイブの課題に対処すること。
  • 既存の手法が無視する中で、インデックス刈り込み中に時間的多様性を保つことで、検索効果を向上させること。
  • 検索結果の多様性をインデックス圧縮に統合する静的刈り込みアプローチを構築すること。
  • 実世界の時間的コレクション上でこの手法を評価し、最先端の刈り込み技術と比較すること。
  • 異なる時間ウィンドウ戦略(Simple、スライディング、ダイナミック)が刈り込み性能に与える影響を調査すること。

提案手法

  • DCGを最大化するための貪欲アルゴリズムに基づく、多様性に基づく静的インデックス刈り込みフレームワークを提案する。
  • 各語について、文書のタイムスタンプに基づく時間分布を計算し、時間的カバレッジをモデル化する。
  • 時間範囲を定義するための3つの戦略(Simple、スライディング、ダイナミック)を用い、語-クエリ関連付けを定義する。
  • 情報検索指標(DCG)を最大化するとともに時間的多様性を確保するように、トップ-kポスティングを選択する修正された貪欲アルゴリズムを適用する。
  • オフラインの刈り込み中に、関連性と多様性を同時に推定する時間に敏感なスコアリングを採用する。
  • 関連性判断と時間的クエリを用いて、2つの公開コレクション(LATimes(非時間的)、WIKI(時間的))で手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1時間的多様性を組み込むことで、ウェブアーカイブにおけるインデックス刈り込みの性能を向上させ、検索効果を維持できるか?
  • RQ2異なる時間ウィンドウ戦略(Simple、スライディング、ダイナミック)は、多様性に基づく刈り込みの性能にどのように影響するか?
  • RQ3時間的クエリにおいて、多様性に配慮した刈り込み手法は、多様性を無視する手法よりもDCGおよびMAPの観点で優れているか?
  • RQ4刈り込みレベルが検索性能に与える影響は何か?また、多様性の利点は、さまざまな刈り込み比においても持続するか?
  • RQ5時間的期間の粒度(例:日 vs. 世紀)が、多様性に基づく刈り込みの効果にどの程度影響を与えるか?

主な発見

  • Simpleおよびスライディングウィンドウ戦略は、すべてのクエリタイプおよび刈り込みレベルにおいて、IP-uおよび2N2Pベースラインを著しく上回った。
  • 低刈り込みレベルでは、非刈り込みインデックスを上回る性能を示した。これは、低品質なポスティングが効果的に削除されたことを示している。
  • ダイナミックウィンドウ戦略は、GMMを用いた時間分布のクラスタリングが最適でなかったため、性能が低かったと推測される。
  • 時間的期間が広いクエリ(例:世紀や十年)では、各手法間の性能差が縮まり、時間的多様性の重要性が低下した。
  • 本手法は、さまざまな時間的クエリタイプにおいて安定した性能を維持しており、耐障害性とスケーラビリティを示した。
  • 実験により、多様性に配慮した刈り込みが、特に細粒度の時間的クエリにおいて、検索効果を向上させることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。