Skip to main content
QUICK REVIEW

[论文解读] WikiGraphs: A Wikipedia Text - Knowledge Graph Paired Dataset

Luyu Wang, Yujia Li|arXiv (Cornell University)|Jul 20, 2021
Topic Modeling被引用 4
一句话总结

WikiGraphs 引入了一个大规模、自动构建的数据集,将完整的 Wikipedia 文章与相应的 Freebase 知识图谱配对,支持长文本生成和图表示学习的研究。该数据集包含 23,522 对图文对,文章平均长度为 3,534 个词元,图平均包含 38.7 个节点和 48.3 条边,表明改进的图条件化可提升生成与检索质量,尽管当前最先进模型仍存在显著性能差距。

ABSTRACT

We present a new dataset of Wikipedia articles each paired with a knowledge graph, to facilitate the research in conditional text generation, graph generation and graph representation learning. Existing graph-text paired datasets typically contain small graphs and short text (1 or few sentences), thus limiting the capabilities of the models that can be learned on the data. Our new dataset WikiGraphs is collected by pairing each Wikipedia article from the established WikiText-103 benchmark (Merity et al., 2016) with a subgraph from the Freebase knowledge graph (Bollacker et al., 2008). This makes it easy to benchmark against other state-of-the-art text generative models that are capable of generating long paragraphs of coherent text. Both the graphs and the text data are of significantly larger scale compared to prior graph-text paired datasets. We present baseline graph neural network and transformer model results on our dataset for 3 tasks: graph -> text generation, graph -> text retrieval and text -> graph retrieval. We show that better conditioning on the graph provides gains in generation and retrieval quality but there is still large room for improvement.

研究动机与目标

  • 通过创建一个大规模、可扩展且自动构建的数据集,弥合长文本生成模型与小规模图文配对数据集之间的差距。
  • 在真实、长篇幅文本和丰富的知识图谱上,支持条件化文本生成、图生成和图表示学习的基准测试。
  • 提供一个公开可用的资源,支持图到文本生成、文本到图检索以及图条件化语言建模的研究。
  • 克服以往人工标注数据集的局限性,这些数据集规模小,且因图和文本复杂度有限而制约了模型发展。

提出的方法

  • 通过将 WikiText-103 基准中的每个 Wikipedia 文章自动链接到 Freebase 知识库中的相关子图,构建该数据集。
  • 一个自动化流水线基于实体对齐和语义相关性,为每个 Wikipedia 文章提取来自 Freebase 的子图。
  • 最终数据集包含 23,522 对配对样本,每个 Wikipedia 文章平均为 3,533.8 个词元,每个知识图平均包含 38.7 个节点和 48.3 条边。
  • 该方法具备可扩展性,可支持在完整 Wikipedia 语料库上生成超过 300 万个图文对。
  • 基线模型使用 Transformer-XL 架构进行训练,通过不同的编码策略对知识图进行条件化:词袋模型、节点特征和图神经网络(GNN)表示。
  • 在三个任务上评估模型:图到文本生成、图到文本检索和文本到图检索,主要使用 rBLEU 作为评估指标。

实验结果

研究问题

  • RQ1当基于大规模知识图谱进行条件化时,图条件化语言模型能否生成长篇、连贯且相关的内容?
  • RQ2图编码方式的选择(如词袋模型、节点特征、GNN)如何影响生成文本的质量和检索性能?
  • RQ3与基线方法相比,引入图结构在多大程度上提升了文本生成和检索性能?
  • RQ4采样超参数(如生成长度和温度)如何影响图条件化生成中生成文本的质量?
  • RQ5当前最先进模型在这一新型大规模基准上的性能上限如何?主要性能差距仍存在于何处?

主要发现

  • 基于 GNN 的条件化方法在图到文本生成任务中,使用标题条件化时在验证集上取得了最高的 rBLEU 得分 36.49,优于词袋模型和仅使用节点特征的基线模型。
  • 随着图条件化的改进,图到文本生成性能显著提升,rBLEU 从无条件情况下的 9.53 上升至使用 GNN 与标题条件化的 36.49,表明结构化知识提供了强信号。
  • 所有模型在生成长度增加至 4096 个词元时性能均下降,表明在长序列中保持主题连贯性仍是重大挑战。
  • 温度超参数对生成质量有明显影响,中等取值(0.8–1.0)优于过低或过高的值。
  • 最佳基线模型与人类参考文本之间的性能差距仍然显著,表明图条件化生成模型仍有巨大改进空间。
  • 自动化流水线成功构建了一个可扩展、高质量的数据集,覆盖了 WikiText-103 文章的 82.3%,证明了大规模知识图谱与文本配对的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。