Skip to main content
QUICK REVIEW

[论文解读] AMALGUM -- A Free, Balanced, Multilayer English Web Corpus

Luke Gessler, Siyao Peng|arXiv (Cornell University)|Jun 18, 2020
Natural Language Processing Techniques参考文献 32被引用 5
一句话总结

AMALGUM 是一个免费的、语种均衡的、包含 400 万个词元的多层英语网络语料库,通过将领域自适应的 NLP 工具应用于带有丰富自动标注的网络数据构建而成,包括依存句法分析、共指消解、话语树(话语结构理论,RST)以及嵌套实体识别。通过利用多层标注和模型堆叠技术,该语料库实现了接近黄金标准的准确率(部分标注任务最高达 97.37%),并在共指消解和话语句法分析任务上显著提升了性能,为小规模、昂贵的黄金标准数据集提供了可扩展、高质量的替代方案。

ABSTRACT

We present a freely available, genre-balanced English web corpus totaling 4M tokens and featuring a large number of high-quality automatic annotation layers, including dependency trees, non-named entity annotations, coreference resolution, and discourse trees in Rhetorical Structure Theory. By tapping open online data sources the corpus is meant to offer a more sizable alternative to smaller manually created annotated data sets, while avoiding pitfalls such as imbalanced or unknown composition, licensing problems, and low-quality natural language processing. We harness knowledge from multiple annotation layers in order to achieve a "better than NLP" benchmark and evaluate the accuracy of the resulting resource.

研究动机与目标

  • 解决 NLP 研究中大规模、高质量、语种均衡且可自由获取的网络语料库稀缺的问题。
  • 克服机会性网络数据采集方法的局限性,后者常导致低质量或不平衡的标注,以及在分布外文本上 NLP 性能不佳。
  • 开发一个支持使用丰富多层标注进行话语、共指消解和语种差异高级语言学分析的语料库。
  • 证明结合多个 NLP 工具并利用跨任务信息可生成‘优于 NLP’的银色标准数据。
  • 提供一个可扩展、开放获取的资源,使 NLP 模型的训练与评估能够超越如 OntoNotes 或 RST-DT 等小规模专有黄金标准数据集。

提出的方法

  • 通过语种均衡的采样策略,从八种不同的英语语域——新闻、访谈、旅游指南、使用说明、学术论文、小说、传记和论坛——收集网络内容以构建语料库。
  • 在较小的黄金标准语料库(GUM)上微调 NLP 工具,以提升在更大规模 AMALGUM 数据上的性能,确保领域特定的适应性。
  • 使用最先进模型生成多层标注,包括词性标注、依存句法分析、共指消解、嵌套实体识别以及 RST 话语句法分析。
  • 应用模型堆叠技术,整合多个 NLP 系统的预测结果,通过利用共识减少误差传播,从而提高准确率。
  • 整合辅助特征,如文档标记、语种标签、句子类型以及来自外部模型的话语关系预测,以提升性能。
  • 通过 GUM 的黄金标准测试集和现有基准对语料库进行评估,比较零样本工具、领域微调模型和集成方法的性能表现。

实验结果

研究问题

  • RQ1能否在保持语种均衡和开放许可的前提下,构建一个大规模、可自由获取、具备高质量多层 NLP 标注的网络语料库?
  • RQ2与现成的 NLP 工具相比,领域微调和模型堆叠在提升网络数据自动标注准确率方面能达到何种程度?
  • RQ3辅助特征(如语种、标记和跨任务预测)在提升共指消解和话语句法分析质量方面贡献有多大?
  • RQ4像 AMALGUM 这样的‘银色标准’语料库是否能在训练下游 NLP 模型时超越更小的黄金标准数据集?
  • RQ5NLP 工具在 AMALGUM 上的表现与在 OntoNotes 或 RST-DT 等成熟基准上的表现相比如何,特别是在话语句法分析等复杂任务上?

主要发现

  • 通过模型堆叠技术,AMALGUM 在词性标注任务上实现了 97.37% 的 F1 分数,接近黄金标准水平,显著优于零样本工具(93.98% F1)。
  • 在 AMALGUM 上使用 xrenner 模型并结合多层特征进行共指消解,F1 分数达到 71.56%,而标准设置下仅为 66.40%。
  • 话语句法分析的准确率从 GUM 测试集上的 44.07%(J&E14+多层标注)提升至 AMALGUM 上的 45.13%,表明语种和结构特征在句法分析中的价值。
  • 多层标注和模型集成的使用在所有 NLP 任务中均带来一致改进,其中共指消解和话语句法分析的提升最为显著。
  • 尽管在词性标注和句法分析方面表现优异,话语层面任务仍具挑战性,其得分远低于 OntoNotes 上的 SOTA 水平,表明在真实网络数据中仍有改进空间。
  • AMALGUM 的性能在复杂现象(如嵌套实体和话语关系)上比零样本工具更一致、更准确,验证了其作为‘优于 NLP’基准的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。