Skip to main content
QUICK REVIEW

[论文解读] Building a Web-Scale Dependency-Parsed Corpus from CommonCrawl

Alexander Panchenko, Eugen Ruppert|arXiv (Cornell University)|Oct 4, 2017
Topic Modeling参考文献 23被引用 8
一句话总结

本文提出了DepCC,这是迄今为止最大规模的公开可用依存句法分析与命名实体标注的英文语料库,其构建基于Common Crawl网络存档中的3.65亿份文档。作者利用可扩展的MapReduce流水线对数据进行清洗、去重和语言学标注,从而支持高性能自然语言处理模型的训练;在DepCC上训练的分布语义动词相似度模型在SimVerb3500基准测试中表现优于以往最先进模型,证明了大规模网络语言资源的价值。

ABSTRACT

We present DepCC, the largest-to-date linguistically analyzed corpus in English including 365 million documents, composed of 252 billion tokens and 7.5 billion of named entity occurrences in 14.3 billion sentences from a web-scale crawl of the extsc{Common Crawl} project. The sentences are processed with a dependency parser and with a named entity tagger and contain provenance information, enabling various applications ranging from training syntax-based word embeddings to open information extraction and question answering. We built an index of all sentences and their linguistic meta-data enabling quick search across the corpus. We demonstrate the utility of this corpus on the verb similarity task by showing that a distributional model trained on our corpus yields better results than models trained on smaller corpora, like Wikipedia. This distributional model outperforms the state of art models of verb similarity trained on smaller corpora on the SimVerb3500 dataset.

研究动机与目标

  • 为解决现有大规模语料库的局限性,如规模有限、缺乏语言学标注以及可及性差,特别是针对网络规模数据的挑战。
  • 开发一种可扩展的自动化流水线,将原始Common Crawl WET数据转为富含语言学信息、已去重且可搜索的语料库。
  • 创建一个网络规模的、依存句法分析的、命名实体标注的语料库,支持高级自然语言处理任务,且无需大量预处理。
  • 通过展示在动词相似度基准测试中性能优于基于较小规模语料库训练的模型,证明该语料库的实用性。
  • 发布语料库及相关工具(索引、API、网页界面),以促进自然语言处理研究中的广泛访问与复用。

提出的方法

  • 该语料库基于Common Crawl的WET归档构建,其中包含从原始网页提取的纯文本。
  • 采用基于MapReduce的流水线,利用MinHash和shingling技术对文档进行去重,以去除近似重复内容。
  • 流水线对每份文档应用多语言词性标注器、依存句法分析器(Stanford CoreNLP)和命名实体识别器(Stanford NER)。
  • 语言学元数据(词性、依存关系、命名实体)与每个句子一同存储,并附带来源信息(源URL、偏移量)以确保可追溯性。
  • 基于句子及语言学特征构建倒排索引,支持通过网页界面或REST API实现快速搜索。
  • 所有预处理与标注步骤在语料库中统一应用,以确保一致性与可扩展性。

实验结果

研究问题

  • RQ1能否从开放网络中构建的大规模、语言学标注的语料库,在训练分布语义模型方面超越规模较小但经过精心筛选的语料库(如维基百科)?
  • RQ2语料库规模和语言学丰富度(依存句法分析、命名实体识别)在多大程度上提升动词相似度任务的性能?
  • RQ3可扩展的自动化流水线能否有效清洗、去重并标注网络规模的数据以支持自然语言处理研究?
  • RQ4在大规模、依存句法分析的语料库上训练的分布语义模型是否能在SimVerb3500上达到最先进性能?
  • RQ5此类语料库能否作为实际可用的、开箱即用的资源,用于训练语法感知的词嵌入及其他自然语言处理模型?

主要发现

  • DepCC语料库包含3.65亿份文档、2520亿个词符、143亿个句子和75亿个命名实体出现,是目前公开可用的最大规模依存句法分析英文语料库。
  • 在DepCC上训练的分布语义动词相似度模型在SimVerb3500数据集上达到0.782的Spearman等级相关系数,超越了先前最先进水平。
  • 即使使用相同的超参数,该模型在性能上仍优于在维基百科及其他较小语料库上训练的模型,证明了语料库规模与语言学深度的显著影响。
  • 性能提升归因于规模与句法特征的结合,因为模型利用依存句法分析结果捕捉动词使用的结构模式。
  • 该语料库支持通过网页界面和REST API实现高效搜索,且通过溯源追踪功能保障了可重现性与数据溯源能力。
  • 该方法具有可扩展性和可重用性,利用相同流水线可扩展至其他语言。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。