Skip to main content
QUICK REVIEW

[論文レビュー] Measuring the Importance of User-Generated Content to Search Engines

Nicholas Vincent, Isaac Johnson|arXiv (Cornell University)|Jun 20, 2019
Wikis in Education and Collaboration被引用数 14
ひとこと要約

この論文は、6つのクエリタイプにわたり、Googleがユーザー生成コンテンツ(UGC)、特にWikipediaにどれほど依存しているかを実証的に測定している。大規模な検索結果の監査を通じて、特定のクエリではWikipediaが80%を超える結果に登場し、最も一般的な単一のコンテンツソースであることが判明した。これはUGCが検索エンジンのパフォーマンスにおいて極めて重要な役割を果たしていることを示しており、知能システムにおけるユーザーの報酬についての疑問を提起している。

ABSTRACT

Search engines are some of the most popular and profitable intelligent technologies in existence. Recent research, however, has suggested that search engines may be surprisingly dependent on user-created content like Wikipedia articles to address user information needs. In this paper, we perform a rigorous audit of the extent to which Google leverages Wikipedia and other user-generated content to respond to queries. Analyzing results for six types of important queries (e.g. most popular, trending, expensive advertising), we observe that Wikipedia appears in over 80% of results pages for some query types and is by far the most prevalent individual content source across all query types. More generally, our results provide empirical information to inform a nascent but rapidly-growing debate surrounding a highly-consequential question: Do users provide enough value to intelligent technologies that they should receive more of the economic benefits from intelligent technologies?

研究の動機と目的

  • Googleのような検索エンジンが、Wikipediaのようなユーザー生成コンテンツ(UGC)をどれほど広く利用してユーザーのクエリに応答しているかを調査すること。
  • 人気・トレンド・広告価値の高いクエリを含む、多様で影響力のあるクエリタイプにおいて、UGCの相対的な普及度と影響力を評価すること。
  • ユーザーが価値あるコンテンツを生成している場合、それらが知能技術からより大きな経済的利益を受け取るべきかどうかという、議論の拡大を裏付ける実証的証拠を提供すること。
  • Googleの検索結果を厳密に大規模に監査し、現実世界の検索パフォーマンスにおけるUGCの役割を定量化すること。

提案手法

  • 本研究は、ユーザーの情報ニーズの異なるタイプを表す6つの明確に分類されたクエリカテゴリにわたり、Google検索結果の大規模かつ体系的な監査を実施している。
  • クエリは、現実世界での重要性に基づいて選定されている:最も人気のあるもの、トレンドにあるもの、広告費が高額なもの、その他の高影響力のカテゴリ。
  • 各クエリについて、上位100件の結果を分析し、Wikipediaやその他のUGCソースの存在と頻度を特定している。
  • 分析には、コンテンツソースの直接同定と、クエリタイプごとのUGCの普及度の比較が含まれている。
  • データセット全体にわたり、ソースの帰属付けの一貫性と信頼性を確保するため、制御された再現性のあるメソドロジーが用いられている。
  • 結果は集約され、統計的に分析され、UGC、特にWikipediaの検索結果ページにおける全体的な優位性を特定している。

実験結果

リサーチクエスチョン

  • RQ1Googleは、一般的なクエリや高影響力のクエリに対して、Wikipediaのようなユーザー生成コンテンツにどれほど依存しているか?
  • RQ2トレンドや広告価値の高いクエリなどの異なるタイプのクエリにおいて、Wikipediaやその他のUGCソースの普及度はどのように変化するか?
  • RQ3Googleの検索結果において、Wikipediaが他のコンテンツソースと比較して相対的にどれほど優位であるか?
  • RQ4UGCへの依存は、ユーザーが知能システムに貢献していることから、より大きな経済的報酬を受け取るべきだとする主張を支持するか、あるいは挑戦するか?

主な発見

  • 少なくとも6つのクエリタイプのうち1つにおいて、Wikipediaは80%を超える検索結果ページに登場しており、Googleの結果におけるその圧倒的な存在感を示している。
  • Wikipediaは、すべてのクエリタイプにおいて、最も普及している個別のコンテンツソースであり、他のウェブサイトやコンテンツプロバイダーを大きく上回っている。
  • 本研究は、ユーザー生成コンテンツが単なる軽微な貢献者ではなく、Googleの検索結果エコシステムの基盤的要素であることを確認している。
  • 結果から、検索エンジンがUGC、特にWikipediaのような高品質で協働的なプラットフォームから著しく価値を得ていることが示唆されている。
  • これらの発見は、コンテンツを生成するユーザーが、それらが支えるシステムからより高い認識と潜在的な経済的利益を受け取るべきだとする主張に強く実証的根拠を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。