Skip to main content
QUICK REVIEW

[论文解读] Logical Natural Language Generation from Open-Domain Tables

Wenhu Chen, Jianshu Chen|arXiv (Cornell University)|Apr 22, 2020
Topic Modeling参考文献 44被引用 10
一句话总结

本文提出了逻辑自然语言生成(LogicNLG)这一新任务,要求模型生成的自然语言语句在逻辑上由开放域表格中的事实所蕴含,超越了表面层次的改写。作者基于TabFact构建了新的数据集LogicNLG,并提出了评估逻辑一致性的自动指标。主要发现表明,预训练语言模型显著提升了逻辑一致性,而强化学习与对抗训练则在流畅性与一致性之间产生权衡,粗粒度到细粒度的生成策略有助于平衡两者。

ABSTRACT

Neural natural language generation (NLG) models have recently shown remarkable progress in fluency and coherence. However, existing studies on neural NLG are primarily focused on surface-level realizations with limited emphasis on logical inference, an important aspect of human thinking and language. In this paper, we suggest a new NLG task where a model is tasked with generating natural language statements that can be \emph{logically entailed} by the facts in an open-domain semi-structured table. To facilitate the study of the proposed logical NLG problem, we use the existing TabFact dataset \cite{chen2019tabfact} featured with a wide range of logical/symbolic inferences as our testbed, and propose new automatic metrics to evaluate the fidelity of generation models w.r.t.\ logical inference. The new task poses challenges to the existing monotonic generation frameworks due to the mismatch between sequence order and logical order. In our experiments, we comprehensively survey different generation architectures (LSTM, Transformer, Pre-Trained LM) trained with different algorithms (RL, Adversarial Training, Coarse-to-Fine) on the dataset and made following observations: 1) Pre-Trained LM can significantly boost both the fluency and logical fidelity metrics, 2) RL and Adversarial Training are trading fluency for fidelity, 3) Coarse-to-Fine generation can help partially alleviate the fidelity issue while maintaining high language fluency. The code and data are available at \url{https://github.com/wenhuchen/LogicNLG}.

研究动机与目标

  • 为解决当前神经机器自然语言生成(NLG)中缺乏逻辑推理的问题,该问题目前仅关注表面层次的事实重述。
  • 提出一种新的NLG任务——逻辑NLG,要求生成的文本必须在逻辑上由半结构化表格中的事实所蕴含。
  • 构建一个新的基准数据集LogicNLG,源自TabFact,丰富了包括比较、计数及算术运算在内的多样化逻辑推理类型。
  • 设计并评估新的自动指标以评估逻辑一致性,超越表面事实匹配的范畴。
  • 探究不同生成架构与训练策略在新逻辑一致性约束下的表现。

提出的方法

  • 作者通过扩展TabFact数据集,加入最大值/最小值/求和、比较(相同/不同)以及计数(总计/仅)等逻辑推理类型,构建了LogicNLG数据集。
  • 提出两种自动评估指标:基于解析的方法与基于自然语言推理(NLI)的方法,用以判断生成的文本是否在逻辑上被表格所蕴含。
  • 研究评估了多种生成模型:LSTM、Transformer以及预训练语言模型(如GPT-2),并采用多种训练方法,包括强化学习(RL)、对抗训练与粗粒度到细粒度的解码策略。
  • 提出一种非单调的粗粒度到细粒度生成模型,以解决序列顺序与逻辑顺序之间的不匹配问题,通过前向规划提升逻辑一致性。
  • 模型通过自动指标与人工标注双重评估,人工评估用于验证自动评分的可靠性。
  • 作者在 https://github.com/wenhuchen/LogicNLG 发布代码与数据,以支持可复现性与进一步研究。

实验结果

研究问题

  • RQ1现有的神经NLG模型能否生成在逻辑上被表格事实所蕴含的语句,而非仅进行表面改写?
  • RQ2不同生成架构(如LSTM、Transformer、预训练语言模型)在新任务下维持逻辑一致性的表现如何?
  • RQ3强化学习与对抗训练等训练策略在提升逻辑一致性的同时,对流畅性造成的损失有多大?
  • RQ4粗粒度到细粒度的生成能否缓解NLG中序列顺序与逻辑顺序之间的不匹配问题?
  • RQ5自动指标在评估逻辑一致性方面的可靠性如何?其与人类判断的相关性如何?

主要发现

  • 预训练语言模型(如GPT-2)显著提升了流畅性与逻辑一致性,优于标准的Transformer与LSTM模型。
  • 强化学习与对抗训练提升了逻辑一致性,但以牺牲流畅性为代价,表明两者之间存在权衡关系。
  • 粗粒度到细粒度的生成策略有助于缓解逻辑一致性问题,同时保持高流畅性,表明其在处理非单调逻辑依赖关系方面具有有效性。
  • 基于解析的自动指标准确率达到60%,基于NLI的指标达到65%,表明自动一致性评估仍具挑战性,但对模型开发具有重要参考价值。
  • 模型在实体排序与比较操作上表现最佳,但在数值聚合(如平均值、求和)以及罕见操作(如'only'或'unique')上表现显著不佳。
  • 与基于数值的操作相比,基于字符串的操作更容易被模型掌握,凸显了将数值推理整合进NLG中的关键挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。