Skip to main content
QUICK REVIEW

[論文レビュー] An Effective Information Retrieval for Ambiguous Query

Rajendra Kumar Roul, Sanjay K. Sahay|arXiv (Cornell University)|Apr 6, 2012
Web Data Mining and Analysis参考文献 8被引用数 3
ひとこと要約

本稿では、Gensimを用いたベクトル空間モデルとFreeDictionaryを用いてコミュニティベクトルを構築することで、曖昧なクエリに対する非教師あり情報検索の新規アプローチを提案する。語の意味に依存する意味的関連性に基づいて関連するWebページをクラスタリングし、文書ベクトルとコミュニティベクトル間のコサイン類似度を用いて文書をユーザーの意図に一致させることで、検索精度を顕著に向上させる。

ABSTRACT

Search engine returns thousands of web pages for a single user query, in which most of them are not relevant. In this context, effective information retrieval from the expanding web is a challenging task, in particular, if the query is ambiguous. The major question arises here is that how to get the relevant pages for an ambiguous query. We propose an approach for the effective result of an ambiguous query by forming community vector based on association concept of data minning using vector space model and the freedictionary. We develop clusters by computing the similarity between community vectors and document vectors formed from the extracted web pages by the search engine. We use Gensim package to implement the algorithm because of its simplicity and robust nature. Analysis shows that our approach is an effective way to form clusters for an ambiguous query.

研究の動機と目的

  • 「apple」や「java」のような短い多義語を含むクエリに対する関連結果の検索という課題に対処する。
  • ユーザーの意図に基づいて検出された文書を意味的に整合性のあるクラスタにグループ化することで、検索エンジンの効果性を向上させる。
  • 従来のクラスタリングやランク付け手法が、微妙な語の意味の違いを捉えられず、大量の学習データを必要とするという限界を克服する。
  • 軽量な辞書ベースの関連性抽出を用いて、進化を続けるWebコンテンツに適応できる動的でスケーラブルなソリューションを開発する。
  • クエリログやプライバシーを侵害するデータ収集に依存せずに、曖昧なクエリの正確なクラスタリングを実現する。

提案手法

  • 標準の検索エンジンを用いて、曖昧なクエリの上位n件のWebページを抽出する。
  • 文書の前処理として、ストップワードの除去、ポーター法による語根還元、およびMiniparを用いた名詞抽出によるキーワード選定を実施する。
  • Gensim NLPライブラリを用いてTF-IDFスコアを計算し、文書ベクトルを構築する。
  • 曖昧語の各意味(例:「apple」を果物、コンピュータ、会社として)について、FreeDictionaryを照会して関連語を取得し、コミュニティベクトルを形成する。
  • 各意味について、再帰的に辞書を照会して関連語のリストを収集し、正規表現を用いて検出された文書内に存在する語に絞り込む。
  • 文書コーパスに対する各コミュニティベクトル成分のTF-IDF重みを計算し、コサイン類似度を用いて文書を最も関連性の高いクラスタに割り当てる。

実験結果

リサーチクエスチョン

  • RQ1大規模な学習コーパスやクエリログに依存せずに、曖昧なクエリのWeb文書を効果的にクラスタリングする方法は何か?
  • RQ2辞書ベースの関連性から導出されるコミュニティベクトルは、曖昧語の検索結果の関連性をどの程度向上させ得るか?
  • RQ3GensimとFreeDictionaryを用いた軽量で非教師ありの手法は、従来のクラスタリングやランク付けモデルに比べて、語の意味の曖昧さを処理する上で優れているか?
  • RQ4従属構文解析と名詞ベースのキーワード抽出の統合は、クラスタ形成の精度をどのように向上させるか?
  • RQ5提案手法は、動的変化するWebコンテンツに適応しつつも、高いクラスタリング精度を維持できるか?

主な発見

  • 提案手法は、曖昧語「apple」について、果物関連の文書とコンピュータ会社関連の文書を分離する2つの明確なクラスタを形成した。
  • 文書D1とD3は、クラスタC1(appleを果物として)に、D2とD4はクラスタC2(appleをコンピュータ会社として)に、最大のコサイン類似度に基づいて割り当てられた。
  • コサイン類似度指標は、文書とコミュニティベクトルの整合性を効果的に測定できており、類似度値が高いほど特定の語の意味に強い関連性があることを示した。
  • FreeDictionaryの活用と再帰的関連性抽出により、手動ラベル付けを一切行わずとも意味的に整合性のあるクラスタを自動で発見できた。
  • Gensimの効率的なベクトル演算機能を活用し、動的Webコンテンツを処理できることから、本手法は頑健性とスケーラビリティに優れたものであった。
  • 文脈的な関連性を組み込み、クラスタ中心点や大量の学習データに依存しないため、従来のk-meansや語の意味誘導技術に比べて本手法は優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。