Skip to main content
QUICK REVIEW

[论文解读] Structural Neural Encoders for AMR-to-text Generation

Marco Damonte, Shay B. Cohen|arXiv (Cornell University)|Mar 27, 2019
Topic Modeling参考文献 28被引用 11
一句话总结

本文提出基于图神经网络(GNN)的结构编码器用于AMR到文本的生成,表明在抽象意义表示(AMR)图中显式建模重叠结构和长距离依赖可提升生成质量。最佳模型为GCN-BiLSTM架构,在LDC2015E86上达到24.40 BLEU,在LDC2017T10上达到24.54 BLEU,分别优于先前工作1.1和1.24 BLEU点。

ABSTRACT

AMR-to-text generation is a problem recently introduced to the NLP community, in which the goal is to generate sentences from Abstract Meaning Representation (AMR) graphs. Sequence-to-sequence models can be used to this end by converting the AMR graphs to strings. Approaching the problem while working directly with graphs requires the use of graph-to-sequence models that encode the AMR graph into a vector representation. Such encoding has been shown to be beneficial in the past, and unlike sequential encoding, it allows us to explicitly capture reentrant structures in the AMR graphs. We investigate the extent to which reentrancies (nodes with multiple parents) have an impact on AMR-to-text generation by comparing graph encoders to tree encoders, where reentrancies are not preserved. We show that improvements in the treatment of reentrancies and long-range dependencies contribute to higher overall scores for graph encoders. Our best model achieves 24.40 BLEU on LDC2015E86, outperforming the state of the art by 1.1 points and 24.54 BLEU on LDC2017T10, outperforming the state of the art by 1.24 points.

研究动机与目标

  • 探究在AMR图中显式建模重叠结构和长距离依赖是否能提升文本生成性能。
  • 比较序列化、树结构和图结构编码器在AMR到文本生成中的有效性。
  • 评估保留重叠结构的图编码器是否优于树结构或序列化编码器。
  • 通过对比示例分析模型在指代和控制结构现象中的行为。
  • 评估长距离依赖对不同编码器类型模型性能的影响。

提出的方法

  • 通过Levi图构造将带标签的AMR边转换为无标签边,构建图结构输入表示,以保留结构信息。
  • 使用图卷积网络(GCN)将AMR图编码为上下文表示,随后通过双向LSTM进行序列建模。
  • 模型采用基于注意力的序列到序列框架,将GCN编码的图作为解码过程的上下文。
  • 为进行比较,实现了序列化和树结构编码器:前者将AMR线性化为字符串,后者通过移除重叠结构形成树形结构。
  • 模型在LDC2015E86和LDC2017T10数据集上端到端训练,使用交叉熵损失和束搜索解码。
  • 引入对比评估设置,生成3,000多个受控变化的示例,调整先行词、代词类型、数和人称,以探测指代处理能力。

实验结果

研究问题

  • RQ1在AMR图中显式编码重叠结构是否能提升AMR到文本生成的性能?
  • RQ2图编码器在处理AMR图中的长距离依赖方面,与树结构和序列化编码器相比表现如何?
  • RQ3重叠结构和长距离依赖在图结构编码器的性能提升中分别起到多大程度的贡献?
  • RQ4不同模型架构在处理指代和控制结构方面的能力有何差异?
  • RQ5图编码器的性能提升是源于对重叠结构的更好建模,还是对长距离依赖的捕捉,或两者兼有?

主要发现

  • 图编码器优于序列化和树结构编码器,在LDC2015E86上达到24.40 BLEU,较之前最先进模型提升1.1点。
  • 在LDC2017T10上,图编码器达到24.54 BLEU,较先前最先进模型提升1.24点。
  • 图编码器在长距离依赖任务上表现更优,且随着依赖长度增加,性能差距进一步扩大。
  • 模型在代词数和人称替换任务中表现最佳,表明其在处理代词指代方面优于序列化和树结构基线。
  • 对比评估显示,图编码器在性别替换任务中保持95.79%的高准确率,表明其在处理性别代词方面具有鲁棒性。
  • 结果表明,重叠结构建模和长距离依赖捕捉都是图编码器性能提升的关键因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。