Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Word Discovery with Segmental Neural Language Models.

Kazuya Kawakami, Chris Dyer|arXiv (Cornell University)|Sep 27, 2018
Natural Language Processing Techniques参考文献 10被引用 11
一句话总结

本文提出了一种分段神经语言模型,通过结合神经网络与贝叶斯非参数先验,从未分词的字符序列中发现类似词的单元。该模型在预测性能上优于LSTM语言模型,并生成的分词结果与当前最先进的词发现方法相当,同时引入可微正则化器以防止对词汇记忆的过度依赖。

ABSTRACT

We propose a segmental neural language model that combines the representational power of neural networks and the structure learning mechanism of Bayesian nonparametrics, and show that it learns to discover semantically meaningful units (e.g., morphemes and words) from unsegmented character sequences. The model generates text as a sequence of segments, where each segment is generated either character-by-character from a sequence model or as a single draw from a lexical memory that stores multi-character units. Its parameters are fit to maximize the marginal likelihood of the training data, summing over all segmentations of the input, and its hyperparameters are likewise set to optimize held-out marginal likelihood. To prevent the model from overusing the lexical memory, which leads to poor generalization and bad segmentation, we introduce a differentiable regularizer that penalizes based on the expected length of each segment. To our knowledge, this is the first demonstration of neural networks that have predictive distributions better than LSTM language models and also infer a segmentation into word-like units that are competitive with the best existing word discovery models.

研究动机与目标

  • 开发一种神经语言模型,能够从未分词的字符序列中发现诸如词素和词等有意义的语言单元。
  • 结合神经网络的表征能力与贝叶斯非参数方法的结构学习能力,以提升分词质量和泛化能力。
  • 通过最大化训练数据所有可能分词路径的边缘似然,优化模型参数与超参数。
  • 通过引入可微正则化器,惩罚长段落的期望长度,防止对词汇记忆的过度使用,从而提升泛化能力。
  • 证明该模型在未分词文本上的预测性能优于LSTM语言模型,同时生成具有竞争力的类似词分词结果。

提出的方法

  • 该模型将文本生成为一系列段落,其中每个段落要么通过循环序列模型逐字符生成,要么整体从存储多字符单元的词汇记忆中提取。
  • 模型参数通过最大化输入序列所有可能分词路径的边缘似然进行训练,从而整合分词不确定性的积分。
  • 通过优化保留数据的边缘似然来调整超参数,实现自动模型选择。
  • 引入一种可微正则化器,惩罚段落的期望长度,抑制对词汇记忆的过度使用,从而改善泛化能力。
  • 模型采用贝叶斯非参数先验,使可灵活、基于数据发现不同单元的数量,而无需预先指定词汇表大小。
  • 该架构支持端到端训练,通过基于梯度的优化,尽管分词和词汇单元本身具有离散性。

实验结果

研究问题

  • RQ1神经语言模型能否联合从未分词的原始字符序列中学习分段边界和有意义的语言单元?
  • RQ2将神经网络与贝叶斯非参数先验结合,是否能同时提升预测性能与分词质量,优于标准模型?
  • RQ3可微正则化器是否能有效控制对词汇记忆的过度依赖,并在无监督词发现中提升泛化能力?
  • RQ4该模型在未分词文本上的预测性能与LSTM语言模型相比如何?
  • RQ5所发现的分段在多大程度上对应于语义上有意义的单元,如词素和词?

主要发现

  • 该模型在保留的测试数据上实现了优于标准LSTM语言模型的预测性能,表明其语言建模能力更强。
  • 该模型发现的分词结果在分词质量上与当前最先进的无监督词发现模型相当。
  • 可微正则化器成功减少了对词汇记忆的过度使用,从而提升了泛化能力与分词的鲁棒性。
  • 该模型能够从未分词的字符序列中直接学习词素和词等语言单元,而无需任何预分词处理。
  • 对所有分词路径的边缘似然优化,使模型能够以一致的方式端到端学习结构与参数。
  • 该方法首次展示了神经网络模型在预测性能上优于LSTM的同时,还能同时发现类似词的单元。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。