[论文解读] Logic2Text: High-Fidelity Natural Language Generation from Logical Forms
本文提出了 Logic2Text,一个包含 10,753 对(逻辑形式,自然语言描述)的大规模数据集,用于从多行表格中进行高保真自然语言生成。通过将逻辑形式作为中间语义表示,该方法实现了可控且事实正确的生成,GPT-2 在人类评估中达到了 82.4% 的事实正确率,证明了逻辑形式在提升生成保真度方面起着关键作用。
Previous works on Natural Language Generation (NLG) from structured data have primarily focused on surface-level descriptions of record sequences. However, for complex structured data, e.g., multi-row tables, it is often desirable for an NLG system to describe interesting facts from logical inferences across records. If only provided with the table, it is hard for existing models to produce controllable and high-fidelity logical generations. In this work, we formulate logical level NLG as generation from logical forms in order to obtain controllable, high-fidelity, and faithful generations. We present a new large-scale dataset, extsc{Logic2Text}, with 10,753 descriptions involving common logic types paired with the underlying logical forms. The logical forms show diversified graph structure of free schema, which poses great challenges on the model's ability to understand the semantics. We experiment on (1) Fully-supervised training with the full datasets, and (2) Few-shot setting, provided with hundreds of paired examples; We compare several popular generation models and analyze their performances. We hope our dataset can encourage research towards building an advanced NLG system capable of natural, faithful, and human-like generation. The dataset and code are available at https://github.com/czyssrs/Logic2Text.
研究动机与目标
- 为解决现有自然语言生成(NLG)系统仅能从结构化数据生成表面级描述的局限性,特别是针对复杂、多行表格的场景。
- 通过引入逻辑形式作为中间表示,实现跨表格记录的高层级推理,从而提升生成的保真度与可控性。
- 提供一个高质量、大规模的数据集,包含多样化的自由模式逻辑形式和人工标注的描述,用于模型训练与评估。
- 通过完全监督和少样本学习设置,评估逻辑形式对生成质量的影响。
- 推动先进自然语言生成系统的研究,使其能够实现忠实、类人且逻辑正确的文本生成。
提出的方法
- 本文提出一个新的数据集 Logic2Text,包含 5,600 个开放域表格和 10,800 对由人工专家标注的(逻辑形式,描述)配对。
- 逻辑形式以类似 Python 的程序结构表示,具有多样化的图状语义,编码了诸如计数、最高级、比较级、聚合、多数、唯一和序数等操作。
- 任务被定义为在表格及其对应逻辑形式的条件下的文本生成,将推理与语言实现解耦。
- 基线模型包括指针-生成器、graph2seq、Transformer 和 GPT-2,均在完全监督和少样本学习设置下进行评估。
- 通过专家进行人工评估,以衡量语义正确性和流畅性,每种方法均检查 200 个样本以评估保真度。
- 进行消融实验,分析输入中表格标题、表头和内容对生成质量的贡献。
实验结果
研究问题
- RQ1与仅从表格生成相比,提供逻辑形式作为输入在多大程度上提升了自然语言生成输出的事实正确率和流畅性?
- RQ2在完全监督和少样本学习设置下,预训练语言模型(如 GPT-2)在逻辑形式引导下能实现多高的保真度生成?
- RQ3不同输入组件(表格标题、表头和内容)对生成描述质量的贡献如何?
- RQ4在从逻辑形式生成文本时,不同神经生成模型在语义正确性和流畅性方面表现如何比较?
- RQ5所提出的数据集能否支持反向任务(如语义解析,即文本到逻辑形式的生成)?其如何提升评估的可靠性?
主要发现
- 当从逻辑形式生成时,GPT-2 模型在人类评估中达到了 82.4% 的事实正确率,显著优于以往仅从表格生成时仅 20.2% 的事实正确率。
- 在完全监督设置下,GPT-2 的 BLEU-4 得分为 31.44,ROUGE-L 得分为 53.99,表明在自动指标上表现优异。
- 即使仅使用 1,000 个训练样本,GPT-2 的 ROUGE-L 得分仍达到 47.67,显示出强大的少样本泛化能力。
- 消融实验表明,表格标题和表头提供了强有力的上下文信号,其中标题对性能贡献最大。
- 人工评估确认,使用逻辑形式后语义正确性显著提升,尽管 GPT-2 仍偶有事实性或逻辑性错误,但整体保真度保持较高水平。
- 由于每个逻辑形式与参考描述之间存在唯一映射关系,该数据集可实现对语义正确性的精确评估,避免了基于参考的指标中的歧义。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。