Skip to main content
QUICK REVIEW

[论文解读] Cross-Domain Generalization of Neural Constituency Parsers

Daniel Fried, Nikita Kitaev|arXiv (Cornell University)|Jul 9, 2019
Natural Language Processing Techniques参考文献 33被引用 4
一句话总结

本文研究了神经成分解析器的零样本跨领域泛化能力,表明尽管预训练编码器在跨领域上提升了性能,但其对域外数据的提升效果并不显著。关键的是,通过有序解码实现的结构化预测显著提升了精确匹配准确率,并增强了对长跨度和域外语料的泛化能力,即使使用强大的 BERT 基础编码器也是如此。

ABSTRACT

Neural parsers obtain state-of-the-art results on benchmark treebanks for constituency parsing -- but to what degree do they generalize to other domains? We present three results about the generalization of neural parsers in a zero-shot setting: training on trees from one corpus and evaluating on out-of-domain corpora. First, neural and non-neural parsers generalize comparably to new domains. Second, incorporating pre-trained encoder representations into neural parsers substantially improves their performance across all domains, but does not give a larger relative improvement for out-of-domain treebanks. Finally, despite the rich input representations they learn, neural parsers still benefit from structured output prediction of output trees, yielding higher exact match accuracy and stronger generalization both to larger text spans and to out-of-domain corpora. We analyze generalization on English and Chinese corpora, and in the process obtain state-of-the-art parsing results for the Brown, Genia, and English Web treebanks.

研究动机与目标

  • 评估神经成分解析器在无需微调的情况下对域外文本的泛化能力。
  • 在多种领域中比较神经与非神经解析器在零样本设置下的泛化性能。
  • 评估预训练语言表征(如 BERT)是否在域外语料上带来相对于域内语料更大的相对收益。
  • 探究结构化输出预测是否能在强输入表征的基础上进一步提升泛化能力。
  • 通过改进泛化能力,在布朗语料库、Genia 和英语网页树库上建立最先进结果。

提出的方法

  • 在域内 WSJ 和 CTB 树库上训练最先进的神经解析器(Chart 和 In-Order)
  • 在零样本设置下,对域外英语语料(布朗、Genia、EWT)和中文语料(CTB)进行泛化性能评估
  • 将基于 BERT 的预训练编码器集成到两种神经解析器架构中,以评估其对领域泛化的影响
  • 将结构化解码(In-Order,依赖先前预测结构)与非结构化解码(Chart,独立预测跨度)进行比较
  • 使用 F1 分数和精确匹配准确率衡量性能,并按跨度长度分层分析
  • 使用标准基准划分,并报告先前研究中测试集的结果,以便直接比较

实验结果

研究问题

  • RQ1在零样本设置下,神经成分解析器在域外语料上的泛化能力是否与非神经解析器相当?
  • RQ2预训练语言表征(如 BERT)是否在域外树库上带来相对于域内树库更大的相对改进?
  • RQ3即使使用强预训练编码器,结构化预测(如通过基于转移的解码)是否仍能提升对长跨度和域外文本的泛化能力?
  • RQ4在域内基准(如 WSJ)上的改进是否能可靠地迁移到域外设置?
  • RQ5在不同领域和跨度长度下,结构化与非结构化神经解析器的精确匹配准确率如何比较?

主要发现

  • 神经和非神经解析器在域外语料上的泛化能力相当,且在各领域中的相对性能下降程度相似。
  • 预训练的 BERT 编码器在所有领域中均提升了 F1 分数,但域内与域外数据的相对误差减少程度一致,表明对域外泛化并无显著优势。
  • In-Order 解析器(结构化解码器)在所有领域中的精确匹配准确率均高于 Chart 解析器(非结构化解码器),绝对提升幅度在 0.5 至 2.8 个百分点之间。
  • 对于较长跨度(≥30–40 个词),In-Order 解析器在 F1 上显著优于 Chart 解析器,且性能差距仅在长跨度时显现,域内 WSJ 测试集中未观察到此现象。
  • 尽管在域内数据上的 F1 分数相似,但结构化 In-Order 解析器在域外语料和长跨度上的泛化能力更强,表明结构化预测能增强模型鲁棒性。
  • 作者在布朗、Genia 和英语网页树库上实现了最先进 F1 分数,即使未使用集成或自训练,也超越了先前工作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。