Skip to main content
QUICK REVIEW

[論文レビュー] ClueWeb22: 10 Billion Web Documents with Visual and Semantic Information

Arnold Overwijk, Chenyan Xiong|arXiv (Cornell University)|Nov 29, 2022
Web Data Mining and Analysis被引用数 5
ひとこと要約

ClueWeb22 は、商用検索エンジンのインデックスから抽出された 100億ページのウェブコーパスであり、現実世界のウェブ検索の分布を反映する高品質でクリーニング済みのコンテンツを備えています。レンダリング済みページ、解析済み DOM 構造、ニューラル NLP アノテーションといった豊富な視覚的・意味的信号を含んでおり、情報検索、自然言語処理、AI プレトレーニング分野における学術研究用に、初めて大規模かつ産業水準のウェブデータセットが公開されたものです。

ABSTRACT

ClueWeb22, the newest iteration of the ClueWeb line of datasets, provides 10 billion web pages affiliated with rich information. Its design was influenced by the need for a high quality, large scale web corpus to support a range of academic and industry research, for example, in information systems, retrieval-augmented AI systems, and model pretraining. Compared with earlier ClueWeb corpora, the ClueWeb22 corpus is larger, more varied, of higher-quality, and aligned with the document distributions in commercial web search. Besides raw HTML, ClueWeb22 includes rich information about the web pages provided by industry-standard document understanding systems, including the visual representation of pages rendered by a web browser, parsed HTML structure information from a neural network parser, and pre-processed cleaned document text to lower the barrier to entry. Many of these signals have been widely used in industry but are available to the research community for the first time at this scale.

研究の動機と目的

  • 情報検索および自然言語処理分野における学術研究に、大規模で高品質かつ現実的であるウェブコーパスが不足しているという問題に対処すること。
  • MS MARCO のような過去のデータセットやサンプリングされたデータセットとは異なり、ウェブ検索トラフィックの真の分布 — 「ヘッド」と「テール」の両方を含む — を反映したウェブコーパスを提供すること。
  • ブラウザでレンダリングされた視覚的表現、解析済み HTML、意味的埋め込みといった、産業標準のウェブ信号を、初めてスケールアップして研究者に提供すること。
  • 生のウェブデータからテキスト、ドキュメントフィールド、アンカーグラフを事前計算することで、研究の入り口を下げる。
  • リtrieバル拡張 AI や大規模言語モデルのプレトレーニング分野における新規研究を支援するため、現実的で高品質なウェブデータソースを提供すること。

提案手法

  • コーパスは、商用検索エンジンのインデックスから 100億件のウェブページをサンプリングすることで構築され、ユーザーの関与度や検索クエリへの関連性の高いページを優先的に選択した。
  • 3つのカテゴリを定義した:ClueWeb22-B(2億件)は最も人気のある「スーパー・ヘッド」ページ用、ClueWeb22-A(20億件)は頻繁に訪問される「ヘッド」ページ用、ClueWeb22-L(100億件)はバランスの取れた「ヘッドとテール」の分布を再現する。
  • 生の HTML はニューラルネットワークパーサーを用いて構造化された DOM 情報を抽出し、各ページについてブラウザレンダリングにより視覚的表現を生成した。
  • 重複除去、スパムフィルタリング、アダルコンテンツの削除を含む前処理により、高品質なデータを確保した。
  • クリーニング済みテキスト、ドキュメントメタデータ、アンカーグラフは事前計算され、データセットの標準的構成要素として提供された。
  • データセットはカーチャン・メロン大学および The Lemur Project を通じてライセンスされ、大規模な転送には低コストで提供された。

実験結果

リサーチクエスチョン

  • RQ1現実世界のウェブ検索トラフィックの真の分布を反映する大規模で高品質なウェブコーパスを、どのように構築できるか?
  • RQ2レンダリング済みページ画像やニューラル NLP アノテーションといった豊富な視覚的・意味的信号は、学術的ウェブコーパスの現実性と有用性をどの程度向上させ得るか?
  • RQ3公開済みで産業水準のウェブコーパスは、商業 AI ラボと学術研究者との間のデータアクセス格差を是正できるか?
  • RQ4ClueWeb22 は、MS MARCO や C4 のような既存のデータセットと比較して、データ品質、カバレッジ、ウェブコンテンツの代表性においてどの程度優れているか?
  • RQ5事前計算されたクリーニング済みテキストおよび構造化されたメタデータへのアクセスが、リtrieバル拡張 AI や言語モデルのプレトレーニング分野における研究の加速にどのような影響を与えるか?

主な発見

  • ClueWeb22 には 100億件のウェブページが含まれており、ClueWeb22-B(スーパー・ヘッド)に 2億件、ClueWeb22-A(ヘッド)に 20億件、ClueWeb22-L(ヘッドとテール)に 100億件が含まれ、現実の検索トラフィックの分布を反映している。
  • データセットにはブラウザでレンダリングされた視覚的表現、解析済み DOM 構造、プロダクション水準の NLP モデルからの意味的アノテーションが含まれており、視覚的・意味的理解分野における高度な研究を可能にしている。
  • クリーニング済みテキスト、ドキュメントフィールド、アンカーグラフは事前計算され、研究者の研究の入り口を下げるため、即座に下流タスクに利用可能である。
  • 非営利利用を目的としたライセンスで提供され、大規模な転送には最小限の費用が発生するため、学術研究者および非営利研究者にとって広くアクセス可能である。
  • ClueWeb22 は、視覚的レンダリングや意味的解析といった産業標準のウェブ信号をスケールアップして提供する、学術研究分野で初めての公開データセットであり、重要なギャップを埋めている。
  • 商用検索エンジンのインデックスからサンプリングしたことで、ClueWeb09 や ClueWeb12 よりも、あるいは MS MARCO のような派生コーパスよりも、現実のウェブ検索行動をより正確に反映している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。