Skip to main content
QUICK REVIEW

[论文解读] Character Composition Model with Convolutional Neural Networks for Dependency Parsing on Morphologically Rich Languages

Xiang Yu, Ngoc Thang Vu|arXiv (Cornell University)|May 30, 2017
Natural Language Processing Techniques参考文献 14被引用 14
一句话总结

本文提出了一种基于卷积神经网络(CNN)的字符组合模型,用于词形丰富且黏着性强的语言的依存句法分析,取代传统的词表查找嵌入,以更好地处理未登录词(OOV)问题。该模型在SPMRL基准测试中达到最先进性能,优于词表查找和LSTM-based模型,尤其在巴斯克语、匈牙利语和韩语等高OOV语言上表现突出,平均比之前最佳的贪心解析器提升3%。

ABSTRACT

We present a transition-based dependency parser that uses a convolutional neural network to compose word representations from characters. The character composition model shows great improvement over the word-lookup model, especially for parsing agglutinative languages. These improvements are even better than using pre-trained word embeddings from extra data. On the SPMRL data sets, our system outperforms the previous best greedy parser (Ballesteros et al., 2015) by a margin of 3% on average.

研究动机与目标

  • 为解决词形丰富且黏着性强的语言在依存句法分析中的未登录词(OOV)问题,传统词表查找嵌入因罕见或未见的词形而失效。
  • 探究使用卷积神经网络(CNN)进行字符级组合是否能比LSTM等循环模型更好地建模词形结构。
  • 评估基于CNN的字符组合模型是否能在不依赖外部无标注数据的情况下,超越预训练词嵌入和词表查找模型的性能。
  • 通过消融研究分析不同词形成分(前缀、词干、后缀)对句法分析准确率的贡献。

提出的方法

  • 该模型用CNN替代词表查找嵌入,通过处理单词的字符级表示来生成词表示,使用多种滤波器尺寸以捕捉不同长度的n-gram。
  • 字符嵌入经由大小为3至9的滤波器进行卷积,随后进行最大池化,以生成每个单词的固定长度向量表示。
  • 最终的单词表示通过拼接所有滤波器尺寸的池化特征得到,这些特征随后作为输入送入前馈神经网络,用于过渡得分计算。
  • 解析系统采用贪心的基于过渡的方法,使用扩展的Arc-Standard过渡系统,包含Left-2和Right-2过渡以处理非投射依赖关系。
  • 特征模板包括栈和缓冲区中的词元,表示通过先组合每个词元的词、词性标签和标签嵌入,再应用全连接ReLU层计算得出。
  • 模型通过平均随机梯度下降法进行端到端训练,使用依存句法分析过渡的交叉熵损失函数。

实验结果

研究问题

  • RQ1与词表查找和LSTM-based模型相比,基于CNN的字符组合模型是否在词形丰富且黏着性强的语言中显著提升依存句法分析性能?
  • RQ2该字符组合模型在多大程度上缓解了依存句法分析中的未登录词(OOV)问题?
  • RQ3在不同语言中,哪些词形成分(前缀、词干、后缀)对句法分析准确率贡献最大?
  • RQ4在数据稀缺条件下,CNN模型是否比LSTM模型在字符级组合中更具优势,尤其在依存句法分析任务中?

主要发现

  • 基于CNN的字符组合模型在SPMRL基准测试中,平均比之前最佳的贪心解析器在标注依存弧得分(LAS)上提升3%。
  • 在巴斯克语、匈牙利语和韩语等黏着性语言上,CNN模型取得最大提升,部分情况下提升超过5%,这归因于高OOV率。
  • CNN模型始终优于Ballesteros等人(2015)原始及复现的双向LSTM模型,为CNN在解析任务中比LSTM更适合字符级组合提供了实证证据。
  • 该模型显著降低了未登录词的影响:OOV情况下的LAS提升显著高于在词汇内(IV)情况,证实其在处理罕见或未见词方面的有效性。
  • 消融研究显示,后缀是黏着性语言中最具信息量的词形成分,当其被屏蔽时性能下降最大,而在屈折语言中其贡献则不那么显著。
  • 在非黏着性词形丰富语言中,CNN模型至少与词表查找模型性能相当,而在所有黏着性语言中均表现更优,显示出广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。