Skip to main content
QUICK REVIEW

[論文レビュー] Query Expansion Strategy based on Pseudo Relevance Feedback and Term Weight Scheme for Monolingual Retrieval

Rekha Vaidyanathan, Sujoy Das|arXiv (Cornell University)|Feb 18, 2015
Information Retrieval and Search Behavior参考文献 8被引用数 4
ひとこと要約

本稿では、擬似関連フィードバックと等頻度文書分割に基づく新しい語彙重み付け方式を用いた単語言語情報検索のためのクエリ拡張手法を提案する。文書パーティションごとにtf-idfスコアを計算し、最高スコア、平均スコア、または最大キーワード数に基づいて拡張語を選択することで、Terrierを用いてFIRE 2011ヒンディ語および英語テストコレクション上で検索性能が向上する。また、最適な拡張語を動的に選択するルールベースのモデルを提案する。

ABSTRACT

Query Expansion using Pseudo Relevance Feedback is a useful and a popular technique for reformulating the query. In our proposed query expansion method, we assume that relevant information can be found within a document near the central idea. The document is normally divided into sections, paragraphs and lines. The proposed method tries to extract keywords that are closer to the central theme of the document. The expansion terms are obtained by equi-frequency partition of the documents obtained from pseudo relevance feedback and by using tf-idf scores. The idf factor is calculated for number of partitions in documents. The group of words for query expansion is selected using the following approaches: the highest score, average score and a group of words that has maximum number of keywords. As each query behaved differently for different methods, the effect of these methods in selecting the words for query expansion is investigated. From this initial study, we extend the experiment to develop a rule-based statistical model that automatically selects the best group of words incorporating the tf-idf scoring and the 3 approaches explained here, in the future. The experiments were performed on FIRE 2011 Adhoc Hindi and English test collections on 50 queries each, using Terrier as retrieval engine.

研究の動機と目的

  • クエリ拡張技術の向上により、単語言語情報検索の性能を向上させること。
  • 従来のクエリ拡張の限界を克服し、文書の中心的テーマに近い語の近接性に焦点を当てる。
  • 等頻度パーティショニングを用いて文書構造を考慮した語彙重み付け方式の開発。
  • 最高スコア、平均スコア、最大キーワード数の3つの戦略を用いた拡張語選択戦略の評価。
  • スコアと構造的基準に基づいて最適な拡張語グループを自動的に選択するルールベースの統計モデルの基盤を構築すること。

提案手法

  • 擬似関連フィードバックで取得された文書を等頻度パーティションに分割し、文書の中心的テーマに対する語の分布を分析する。
  • 各パーティションごとに、語の頻度-逆文書頻度(tf-idf)スコアを計算し、逆文書頻度(idf)はパーティション数に基づいて算出する。
  • 拡張語の選択に3つの異なる戦略を用いる:(1) 最高スコアの語、(2) パーティション間の平均スコア、(3) 高スコアキーワード数が最大のグループ。
  • 本手法は、文書の中心的アイデアに近い(通常は中央のパーティションに位置する)語がより関連性が高く、したがって拡張の優れた候補であると仮定する。
  • tf-idfスコアと3つの選択戦略を統合し、動的に最適な語グループを選択するルールベースの統計モデルを提案する。
  • 50件のクエリをそれぞれFIRE 2011アドホックヒンディ語および英語テストコレクションで、Terrier検索エンジンを用いて実験を実施する。

実験結果

リサーチクエスチョン

  • RQ1文書を等頻度セグメントに分割することで、関連する拡張語の選択にどのような影響を与えるか?
  • RQ2最高スコア、平均スコア、最大キーワード数の3つの語選択戦略のうち、どの戦略が最も優れた検索性能をもたらすか?
  • RQ3ルールベースのモデルは、tf-idfスコアと構造的語選択を効果的に統合し、クエリ拡張を改善できるか?
  • RQ4文書の中心的テーマへの近接性が、拡張語の関連性にどのように影響するか?
  • RQ5提案された語彙重み付け方式は、標準的手法と比較して、単語言語検索の有効性にどのような影響を与えるか?

主な発見

  • 等頻度パーティショニングを用いることで、文書の中心的テーマに近い語に焦点を当てることで、本手法は検索有効性を向上させる。
  • 3つの選択戦略の中で、最高スコア語アプローチがクエリ全体にわたり最も一貫した検索性能の向上を達成した。
  • 平均スコアおよび最大キーワード数戦略は、クエリの特徴や言語に応じて効果が変動した。
  • 本研究は、文書構造が語の関連性に顕著な影響を与えることを示しており、パーティションベースの語彙重み付けの有効性を裏付けている。
  • ルールベースのモデルは、スコアと構造的基準に基づいて最適な拡張語グループを動的に選択するための実用的なフレームワークであることが示された。
  • 本手法は、FIRE 2011ベンチマークのヒンディ語および英語両方のテストコレクションで、測定可能な検索性能の向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。