Skip to main content
QUICK REVIEW

[论文解读] Denoising Pre-Training and Data Augmentation Strategies for Enhanced RDF Verbalization with Transformers

Sébastien Montella, Betty Fabre|arXiv (Cornell University)|Dec 1, 2020
Topic Modeling参考文献 41被引用 6
一句话总结

本文提出一种基于外部语料(Wikipedia 和自建数据集)的去噪预训练与数据增强策略,以提升基于 Transformer 的 RDF 文本化性能。通过在大规模噪声文本和增强的 RDF 三元组上进行预训练,模型在未见实体上的 BLEU 相对提升达 126.05%,在未见类别上达 88.16%,展现出对分布外数据的强大泛化能力。

ABSTRACT

The task of verbalization of RDF triples has known a growth in popularity due to the rising ubiquity of Knowledge Bases (KBs). The formalism of RDF triples is a simple and efficient way to store facts at a large scale. However, its abstract representation makes it difficult for humans to interpret. For this purpose, the WebNLG challenge aims at promoting automated RDF-to-text generation. We propose to leverage pre-trainings from augmented data with the Transformer model using a data augmentation strategy. Our experiment results show a minimum relative increases of 3.73%, 126.05% and 88.16% in BLEU score for seen categories, unseen entities and unseen categories respectively over the standard training.

研究动机与目标

  • 提升在 WebNLG 基准上对分布外实体和谓词的 RDF 文本生成性能。
  • 解决现有模型在遇到训练中未见的实体或类别时泛化能力差的问题。
  • 探究利用外部语料进行去噪预训练与数据增强在知识库文本化中的有效性。
  • 评估课程学习与预训练策略对 RDF 文本化中零样本与少样本泛化的影响。

提出的方法

  • 构建了两个外部数据集:WS1 来自 Wikipedia,ST1 来自自建的三元组抽取流水线,用于增强训练数据。
  • 在从外部语料中提取的噪声句子上应用去噪自编码器预训练,以提升模型的鲁棒性与语言泛化能力。
  • 采用两阶段训练流程:先在外部数据上进行预训练,再在 WebNLG 数据集上进行微调。
  • 在微调过程中引入课程学习,逐步增加训练难度,尽管其导致了反直觉的性能下降。
  • 将预训练与数据增强相结合,以提升模型在未见实体和谓词上的泛化能力。
  • 训练基于 Transformer 的序列到序列模型,采用去噪目标,并通过多种指标(BLEU、METEOR、chrF++、BLEURT)进行评估。

实验结果

研究问题

  • RQ1在大规模噪声文本上进行去噪预训练,能否提升对未见实体和类别的 RDF 文本化性能?
  • RQ2使用外部语料进行数据增强,如何影响 RDF 文本生成中的泛化能力?
  • RQ3在微调过程中采用课程学习,能否提升对分布外数据的零样本性能?
  • RQ4为何在本设置中课程学习导致性能下降,尽管其在类似任务中曾取得成功?
  • RQ5在知识库文本化中,预训练阶段的数据质量与数据量相比,其相对影响如何?

主要发现

  • 与标准训练相比,该模型在未见实体上的 BLEU 相对提升达 126.05%,表明其对分布外实体具有强大的泛化能力。
  • 在未见类别上,模型实现了 88.16% 的 BLEU 相对提升,证明其能有效处理训练中未见的谓词。
  • 仅在 ST1 数据集上进行预训练,尽管其规模仅为 WS1 的五分之一,但性能优于同时使用两个数据集,表明数据质量与代表性比数据量更为关键。
  • 去噪预训练与 ST1 预训练相结合反而导致性能下降,可能是因为去噪目标与 RDF 三元组线性化之间的输入分布不匹配。
  • 性能最佳的模型在未使用课程学习的情况下,联合使用 WS1 和 ST1 进行训练,其生成文本在流畅性与信息整合方面表现更优。
  • 人工评估显示,尽管模型在已见类别上表现具有竞争力,但在未见数据上的排名较低,表明其在零样本泛化方面仍有改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。