Skip to main content
QUICK REVIEW

[論文レビュー] WikiGraphs: A Wikipedia Text - Knowledge Graph Paired Dataset

Luyu Wang, Yujia Li|arXiv (Cornell University)|Jul 20, 2021
Topic Modeling被引用数 4
ひとこと要約

WikiGraphs は、完全な Wikipedia 記事とそれに該当する Freebase 知識グラフをペアリングした大規模かつ自動的に構築されたデータセットを提供し、長文生成およびグラフ表現学習分野の研究を促進する。このデータセットは、平均して 3,534 ツークの記事と平均 38.7 ノードおよび 48.3 エッジを有するグラフを含む 23,522 件のグラフ・テキストペアで構成されており、より良いグラフ条件付けが生成および検索品質を向上させることを示しているが、最先端モデルにおいても顕著な性能ギャップが残っている。

ABSTRACT

We present a new dataset of Wikipedia articles each paired with a knowledge graph, to facilitate the research in conditional text generation, graph generation and graph representation learning. Existing graph-text paired datasets typically contain small graphs and short text (1 or few sentences), thus limiting the capabilities of the models that can be learned on the data. Our new dataset WikiGraphs is collected by pairing each Wikipedia article from the established WikiText-103 benchmark (Merity et al., 2016) with a subgraph from the Freebase knowledge graph (Bollacker et al., 2008). This makes it easy to benchmark against other state-of-the-art text generative models that are capable of generating long paragraphs of coherent text. Both the graphs and the text data are of significantly larger scale compared to prior graph-text paired datasets. We present baseline graph neural network and transformer model results on our dataset for 3 tasks: graph -> text generation, graph -> text retrieval and text -> graph retrieval. We show that better conditioning on the graph provides gains in generation and retrieval quality but there is still large room for improvement.

研究の動機と目的

  • 長文テキスト生成モデルと小規模なグラフ・テキストペアデータセットの間のギャップを埋めるために、大規模でスケーラブルかつ自動的に構築されたデータセットを提供すること。
  • 現実的で長文のテキストおよび豊富な知識グラフを用いた、条件付きテキスト生成、グラフ生成、グラフ表現学習のベンチマークを可能にすること。
  • グラフからテキストへの生成、テキストからグラフへの検索、グラフ条件付き言語モデルの研究を支援する公開リソースを提供すること。
  • 従来の人手によるアノテーションデータセットの制限を克服し、グラフおよびテキストの複雑さが制限されるため、モデル開発が制限されることを防ぐこと。

提案手法

  • データセットは、WikiText-103 ベンチマークに含まれる各 Wikipedia 記事に対して、Freebase 知識ベースから関連するサブグラフを自動的にリンクすることで構築される。
  • 自動パイプラインにより、エンティティのアライメントと意味的関連性に基づいて、各 Wikipedia 記事に対して Freebase からサブグラフを抽出する。
  • その結果、23,522 件のペアド例が得られ、各 Wikipedia 記事の平均長は 3,533.8 ツーク、各知識グラフの平均ノード数は 38.7、エッジ数は 48.3 である。
  • この手法はスケーラビリティをサポートしており、全 Wikipedia コーパス全体にわたって 300 万件を超えるグラフ・テキストペアの作成が可能である。
  • ベースラインモデルは、Transformer-XL アーキテクチャを用いて、袋(bag-of-words)、ノード特徴量、グラフニューラルネットワーク(GNN)表現といった異なる符号化戦略を用いて知識グラフに条件づけて訓練される。
  • モデルは rBLEU を主な指標として用い、3 つのタスク(グラフからテキストへの生成、グラフからテキストへの検索、テキストからグラフへの検索)で評価される。

実験結果

リサーチクエスチョン

  • RQ1大規模な知識グラフに条件づけられた言語モデルは、長文で一貫性があり関連性の高いテキストを生成できるか?
  • RQ2グラフ符号化の選択(例:袋、ノード特徴量、GNN)が、生成テキストの品質および検索パフォーマンスに与える影響はいかほどか?
  • RQ3グラフ構造を組み込むことで、ベースライン手法と比較してテキスト生成および検索の品質がどの程度向上するか?
  • RQ4長さや温度といったサンプリングハイパーパrameter が、グラフ条件付き生成における生成テキストの品質に与える影響は?
  • RQ5最先端モデルがこの新しい大規模ベンチマークで達成できる現在のパフォーマンスの上限は何か。また、主要なギャップはどこに残っているか?

主な発見

  • GNN を用いた条件付け手法が、タイトル条件付きのグラフからテキストへの生成タスクでバリデーションセットで最高の rBLEU スコア 36.49 を達成し、袋やノードのみのベースラインを上回った。
  • より良いグラフ条件付けが、グラフからテキストへの生成性能を顕著に向上させ、rBLEU が条件なしの 9.53 から GNN とタイトルを併用した 36.49 に上昇した。これは構造化知識からの強力な信号が存在することを示している。
  • サンプル長が長くなる(最大 4096 ツーク)と、すべてのモデルで性能が低下した。これは、長期間にわたりトピックの一貫性を維持することが依然として大きな課題であることを示している。
  • 温度ハイパーパrameter は生成品質に顕著な影響を及ぼし、非常に低いか非常に高い値よりも中程度の値(0.8–1.0)がより良い結果をもたらした。
  • 最高のベースラインと人間の基準テキストとの間のパフォーマンスギャップは依然として大きく、グラフ条件付き生成モデルの改善の余地が広く残っていることを示している。
  • 自動パイプラインは、WikiText-103 の記事の 82.3% をカバーするスケーラブルで高品質なデータセットを成功裏に構築しており、大規模な知識グラフ・テキストペアリングの実現可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。