Skip to main content
QUICK REVIEW

[論文レビュー] Enhanced Trustworthy and High-Quality Information Retrieval System for Web Search Engines

Sumalatha Ramachandran, Sujaya Paulraj|ArXiv.org|Nov 4, 2009
Data Quality and Management参考文献 9被引用数 14
ひとこと要約

この論文では、静的ウェブサイトの信頼性スコアを計算・保存するための信頼性および品質向上型ウェブ検索システムを提案する。このシステムは、出典、権威、年齢、人気、関連リンクの5要因を用いてウェブサイトを評価し、信頼性スコアを算出する。WIQAフレームワークを統合することで、ユーザーが設定可能な品質ベースの順序付けが可能となり、検索の正確性と信頼性の高い結果の提示が向上する。

ABSTRACT

The WWW is the most important source of information. But, there is no guarantee for information correctness and lots of conflicting information is retrieved by the search engines and the quality of provided information also varies from low quality to high quality. We provide enhanced trustworthiness in both specific (entity) and broad (content) queries in web searching. The filtering of trustworthiness is based on 5 factors: Provenance, Authority, Age, Popularity, and Related Links. The trustworthiness is calculated based on these 5 factors and it is stored thereby increasing the performance in retrieving trustworthy websites. The calculated trustworthiness is stored only for static websites. Quality is provided based on policies selected by the user. Quality based ranking of retrieved trusted information is provided using WIQA (Web Information Quality Assessment) Framework.

研究の動機と目的

  • ウェブ検索結果における信頼性の低い情報や矛盾する情報の増加という問題に対処すること。
  • エンティティ固有のクエリおよび広範なコンテンツクエリの両方における信頼性の向上。
  • 静的ウェブサイトの信頼性スコアを事前に計算・保存することで、情報検索のパフォーマンスを向上させること。
  • WIQAフレームワークを用いて、ユーザーがカスタマイズ可能なポリシーに基づく、品質に基づく順序付けを可能とすること。
  • 多要因による信頼性評価を通じて、低品質で誤解を招くコンテンツを検索結果から削減すること。

提案手法

  • 信頼性は、出典、権威、年齢、人気、関連リンクの5要因を用いて算出される。
  • 信頼性スコアは静的ウェブサイトの検索を高速化するために事前に計算・保存される。
  • WIQA(Web Information Quality Assessment)フレームワークを用いて、ユーザーが選択した品質ポリシーに基づき、信頼できる結果を順序付けする。
  • システムは動的ウェブサイトと静的ウェブサイトを区別し、信頼性スコアは静的コンテンツにのみ保存される。
  • 信頼性要因は重み付けされ、合成スコアに統合されてサイトの信頼性を評価する。
  • 特定(エンティティ)および広範(コンテンツ)の両方のクエリタイプに対応するアーキテクチャであり、信頼性フィルタリングが強化されている。

実験結果

リサーチクエスチョン

  • RQ1特定クエリおよび広範クエリの両方に対して、ウェブ検索結果の信頼性をどのように向上できるか?
  • RQ2検索結果におけるウェブコンテンツの信頼性の認識に最も顕著に影響を与える要因は何か?
  • RQ3事前に計算された信頼性スコアは、情報検索の効率性と正確性を向上させることができるか?
  • RQ4ユーザー定義の品質ポリシーを信頼性ベースの順序付けに効果的に統合する方法は何か?
  • RQ5出典、権威、年齢、人気、関連リンクの組み合わせが、結果の信頼性をどの程度向上できるか?

主な発見

  • システムは静的ウェブサイトの信頼性スコアを正常に計算・保存し、検索パフォーマンスの向上を達成した。
  • WIQAフレームワークの統合により、ユーザーのポリシーに基づくカスタマイズ可能な品質ベースの順序付けが可能になった。
  • 出典、権威、年齢、人気、関連リンクの5つの信頼性要因が、総合的に結果の信頼性を向上させた。
  • 事前に計算された信頼性スコアにより、クエリ処理中のランタイムオーバーヘッドが削減され、特に静的コンテンツにおいて顕著だった。
  • システムは、低品質で矛盾する情報のフィルタリングが向上したことを示した。
  • このアプローチは、エンティティ固有のクエリおよび広範なコンテンツクエリの両方で有効であり、全体的な検索品質の向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。