[论文解读] Improving AMR Parsing with Sequence-to-Sequence Pre-training
本文提出了一种用于AMR解析的序列到序列(seq2seq)预训练方法,该方法利用机器翻译、句法解析和AMR解析本身作为预训练任务。通过在这些任务上联合微调,该方法在AMR 2.0上实现了最先进性能,将F1从71.5提升至80.2,且无需复杂的架构修改。
In the literature, the research on abstract meaning representation (AMR) parsing is much restricted by the size of human-curated dataset which is critical to build an AMR parser with good performance. To alleviate such data size restriction, pre-trained models have been drawing more and more attention in AMR parsing. However, previous pre-trained models, like BERT, are implemented for general purpose which may not work as expected for the specific task of AMR parsing. In this paper, we focus on sequence-to-sequence (seq2seq) AMR parsing and propose a seq2seq pre-training approach to build pre-trained models in both single and joint way on three relevant tasks, i.e., machine translation, syntactic parsing, and AMR parsing itself. Moreover, we extend the vanilla fine-tuning method to a multi-task learning fine-tuning method that optimizes for the performance of AMR parsing while endeavors to preserve the response of pre-trained models. Extensive experimental results on two English benchmark datasets show that both the single and joint pre-trained models significantly improve the performance (e.g., from 71.5 to 80.2 on AMR 2.0), which reaches the state of the art. The result is very encouraging since we achieve this with seq2seq models rather than complex models. We make our code and model available at https://github.com/xdqkid/S2S-AMR-Parser.
研究动机与目标
- 为解决人工标注的AMR数据集规模有限的问题,该问题限制了解析器的性能。
- 克服通用预训练模型(如BERT)在seq2seq AMR解析中的局限性,原因在于词汇不匹配和以生成为导向的设计。
- 探究在相关seq2seq任务上进行预训练是否能提升AMR解析性能。
- 研究在多个任务上进行联合预训练是否优于单任务预训练。
- 通过在保持预训练模型响应能力的同时优化AMR解析性能,提升微调效果。
提出的方法
- 在三个任务上预训练seq2seq模型:英英机器翻译、句法解析(使用自动解析的句法树)以及AMR解析(使用自动转换的AMR序列)。
- 所有预训练任务均采用相同的模型架构(基于Transformer),以确保参数共享和语言知识迁移。
- 实施一种多任务学习微调策略,联合优化AMR解析的F1和预训练模型的响应保持能力。
- 使用深度优先遍历将AMR图线性化为序列,并使用特殊标记表示图结构。
- 在大规模单语和双语文本数据上进行训练,包括WMT14英语单语和双语数据集,用于翻译预训练。
- 在两个标准英语AMR基准上进行评估:AMR 2.0和AMR 1.0,以Smatch F1为主要指标。
实验结果
研究问题
- RQ1在相关seq2seq任务上进行预训练是否能提升基于seq2seq的AMR解析器性能?
- RQ2在多个任务(翻译、句法、AMR)上进行联合预训练是否优于单任务预训练?
- RQ3预训练数据的选择(例如翻译中的语言对)如何影响下游AMR解析性能?
- RQ4多任务微调能否在提升AMR解析准确率的同时保持预训练模型的响应质量?
- RQ5所提出的seq2seq预训练方法即使在无复杂架构修改的情况下是否依然有效?
主要发现
- 所提出的单任务预训练方法在AMR 2.0上的AMR解析F1从71.5提升至80.2,达到了最先进性能。
- 在机器翻译和句法解析上进行联合预训练(PTM-MT-WMT14B-SynPar-WMT14M)在AMR 2.0上实现了最高的F1(81.4)。
- 在英法翻译(EN-FR)上进行预训练的表现优于英德翻译(EN-DE),表明语言对的选择会影响性能。
- 多任务学习微调策略优于普通微调,证实了其在保持预训练知识方面的有效性。
- 该方法仅使用通用的seq2seq框架即实现了最先进结果,无需复杂的模型设计或外部工具。
- 消融实验证实,对翻译和解析任务进行预训练能显著提升性能,验证了辅助任务选择的合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。