Skip to main content
QUICK REVIEW

[论文解读] Diversity Enhanced Table-to-Text Generation via Type Control

Yotam Perlitz, Liat Ein-Dot|arXiv (Cornell University)|May 22, 2022
Natural Language Processing Techniques被引用 5
一句话总结

本文提出 DevTC,一种通过逻辑类型(LT)控制增强多样性的表格到文本生成方法,能够从表格数据中生成高质量、事实准确且多样化的自然语言语句。通过在不同逻辑类型(如聚合、比较或计数)上进行条件生成,该模型可为每个输入表格生成多个独特且高质量的输出,在不依赖随机解码的情况下,优于强基线模型,在事实性与多样性权衡上表现更优。

ABSTRACT

Generating natural language statements to convey logical inferences from tabular data (i.e., Logical NLG) is a process with one input and a variety of valid outputs. This characteristic underscores the need for a method to produce a diverse set of valid outputs, presenting different perspectives of the input data. We propose a simple yet effective diversity-enhancing scheme that builds upon an inherent property of the statements, their logic-types, by using a type-controlled table-to-text generation model. We demonstrate, through extensive automatic and human evaluations over the two publicly available Logical NLG datasets, that our proposed method both facilitates the ability to effectively control the generated statement type, and produces results superior to the strongest baselines in terms of quality and factuality-diversity trade-off.

研究动机与目标

  • 为解决现有表格到文本(T2T)生成模型中缺乏多样性和控制性的问题,这些模型常生成冗余或低质量的输出。
  • 实现从单个输入表格生成多个不同、准确且事实正确的语句,代表不同的逻辑视角。
  • 通过用结构化的逻辑类型条件控制替代随机解码,改善事实性与多样性的权衡。
  • 证明逻辑类型控制可提升 T2T 生成的质量与可控性。
  • 表明即使在缺少逻辑类型注释的情况下,模型仍保持鲁棒性,在自动评估与人工评估中均优于基线模型。

提出的方法

  • 该方法引入一种基于逻辑类型(LT)控制的 T2T 生成模型,通过在七种预定义 LT 类型(计数、比较、最高级、唯一、序数、聚合、多数)之一上进行条件生成,实现高质量语句生成。
  • 在 Logic2Text 数据集的 8.5K 个(语句, LT)配对上微调一个基于 BERT 的分类器,以自动标注训练数据中的 LT,测试集上达到 97% 的宏 F1 分数。
  • 推理阶段,DevTC 通过从七类 LT 中均匀采样五种不同的 LT 对模型进行条件控制,生成五条多样化的语句,实现可控多样性,无需依赖随机解码。
  • 模型利用预训练的 T2T 生成器(如 GPT-TabGen),并结合表格和目标 LT 对其进行条件控制,采用序列到序列框架,将 LT 嵌入作为输入。
  • 该方法将 LT 预测与生成过程解耦,通过更精确的监督提升事实性,避免因随机解码导致的性能下降。
  • 该框架在两个公开数据集(LogicNLG 和 Logic2Text)上进行评估,结合自动指标与人工标注进行验证。

实验结果

研究问题

  • RQ1逻辑类型控制能否实现从单个表格输入生成多样且高质量的语句?
  • RQ2与基于随机解码的基线相比,LT 控制生成是否能改善事实性与多样性的权衡?
  • RQ3当输入的 LT 缺失时,模型在多大程度上仍能保持对生成语句逻辑类型的控制?
  • RQ4在流畅性、充分性与事实正确性方面,该模型与当前最先进 T2T 模型相比表现如何?
  • RQ5该模型能否在包括罕见或词汇多变类型(如序数)在内的多种逻辑类型上生成事实准确的语句?

主要发现

  • DevTC 在事实性与多样性权衡上优于最强基线模型 GPT-TabGen,在自动评估中位于帕累托前沿更优位置。
  • 人工评估显示,DevTC 在 55% 的情况下被判断为比基线更符合事实,且具有统计显著优势(p < 0.05)。
  • 模型在七类逻辑类型上的平均 LT 一致性达到 79.8%,显著优于基线模型的 17% 一致性。
  • 对于序数逻辑类型(因词汇差异与训练数据有限导致一致性最低),其一致性为 68.4%,表明在罕见类型上仍有改进空间。
  • 即使在无输入 LT 的情况下,DevTC 仍保持高事实性,在自动评估与人工评估中均优于基线模型。
  • 该方法避免了随机解码通常导致的性能下降,因为多样性通过结构化的 LT 条件控制实现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。