Skip to main content
QUICK REVIEW

[论文解读] Web-scale Surface and Syntactic n-gram Features for Dependency Parsing

Dominick Ng, Mohit Bansal|arXiv (Cornell University)|Feb 25, 2015
Natural Language Processing Techniques参考文献 13被引用 3
一句话总结

本文从 Google Books 和 Google Syntactic Ngrams 语料库中提取了新颖的一阶和二阶表面及句法 n-gram 特征,以提升依存句法分析的准确性。通过将这些互补特征与 MSTParser 结合,作者在网页文本上实现了最高 1.4% 的绝对 UAS 提升,在新闻语料上实现了 0.8% 的提升,表明在域内和域外设置下均有显著增益。

ABSTRACT

We develop novel first- and second-order features for dependency parsing based on the Google Syntactic Ngrams corpus, a collection of subtree counts of parsed sentences from scanned books. We also extend previous work on surface $n$-gram features from Web1T to the Google Books corpus and from first-order to second-order, comparing and analysing performance over newswire and web treebanks. Surface and syntactic $n$-grams both produce substantial and complementary gains in parsing accuracy across domains. Our best system combines the two feature sets, achieving up to 0.8% absolute UAS improvements on newswire and 1.4% on web text.

研究动机与目标

  • 使用来自多样化来源的大规模、网络规模的 n-gram 特征来提升依存句法分析的准确性。
  • 将一阶表面 n-gram 扩展为二阶特征,以增强上下文建模能力。
  • 探究扫描书籍语料库(Google Books、Syntactic Ngrams)作为表面和句法 n-gram 来源的实用性。
  • 评估表面和句法 n-gram 特征在域内(新闻语料)和域外(网页树库)设置下的互补性。
  • 评估不同 n-gram 来源语料库(Web1T 与 Google Books)和特征类型对句法分析性能的影响。

提出的方法

  • 从 Web1T 和 Google Books Ngram 语料库中提取一阶和二阶表面 n-gram,基于 log2(频率)/5 的分桶频率计数以减少稀疏性。
  • 从包含 3450 亿词 parsed 扫描书籍的 Google Syntactic Ngrams 语料库中开发句法 n-gram 特征。
  • 通过词、词性标注、方向性(主词在左/右)以及分桶频率(每 5 个单位分桶)对特征进行编码,以提升运行时效率。
  • 使用主词-论元依赖关系前后及之间的高频词和词性标注,生成类释义的上下文特征。
  • 在训练期间预计算特征计数以加速推理,使用最低频率阈值 10,000 以减少 OCR 和句法分析错误带来的噪声。
  • 在基于图的 MSTParser 中结合表面和句法 n-gram 特征,评估在无标签附件得分(UAS)上的互补增益。

实验结果

研究问题

  • RQ1与一阶特征相比,来自 Google Books Ngram 语料库的二阶表面 n-gram 是否能提升句法分析准确率?
  • RQ2在不同领域中,来自 Google Syntactic Ngrams 语料库的句法 n-gram 特征与表面 n-gram 特征相比,其句法分析准确率如何?
  • RQ3当在依存句法分析器中结合使用时,表面和句法 n-gram 特征是否能提供互补的性能提升?
  • RQ4在域外设置下,Web1T 的特征与 Google Books Ngram 语料库的特征相比,性能表现如何?
  • RQ5来自扫描书籍语料库的特征在多大程度上缓解了表面 n-gram 中线性词序依赖的局限性?

主要发现

  • 结合表面和句法 n-gram 特征的最佳系统在新闻语料上达到 92.5% 的 UAS,在网页文本上达到 85.2% 的 UAS,分别相对于基线的 91.7% 和 83.8% 实现了 0.8% 和 1.4% 的绝对提升。
  • 来自 Google Books Ngram 语料库的二阶表面 n-gram 提供了统计上显著的增益,尽管其总 n-gram 数量仅为 Web1T 的一半,但性能表现相当。
  • 句法 n-gram 特征带来了显著的性能提升,尤其在处理句法歧义方面表现突出,但其性能受到源语料库中句法分析和 OCR 错误的限制。
  • Web1T 与 Google Books 之间 n-gram 查询的交集仅为 24.7%,表明两者语料在分布上存在显著差异,这可能解释了其特征的互补性。
  • 表面和句法 n-gram 特征被证实具有互补性,联合系统充分利用了各自优势:表面 n-gram 用于词汇共现建模,句法 n-gram 用于结构歧义消解。
  • 尽管 Google Syntactic Ngrams 语料库中可能存在 OCR 和句法分析错误带来的噪声,但其特征计数仍表现出鲁棒性和实用性,尤其是在与表面 n-gram 特征结合使用时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。