Skip to main content
QUICK REVIEW

[论文解读] $gen$CNN: A Convolutional Architecture for Word Sequence Prediction

Mingxuan Wang, Zhengdong Lu|arXiv (Cornell University)|Mar 17, 2015
Natural Language Processing Techniques参考文献 24被引用 11
一句话总结

本文提出 $gen$CNN,一种用于词序列预测的新型卷积神经网络架构,能够在不依赖循环单元的情况下捕捉文本中的局部与长距离依赖关系。通过采用递归的多尺度卷积结构及卷积门控机制,$gen$CNN 在语言建模和神经机器翻译的 n-best 重排序任务中实现了最先进性能,显著优于 RNN 和 LSTM。

ABSTRACT

We propose a novel convolutional architecture, named $gen$CNN, for word sequence prediction. Different from previous work on neural network-based language modeling and generation (e.g., RNN or LSTM), we choose not to greedily summarize the history of words as a fixed length vector. Instead, we use a convolutional neural network to predict the next word with the history of words of variable length. Also different from the existing feedforward networks for language modeling, our model can effectively fuse the local correlation and global correlation in the word sequence, with a convolution-gating strategy specifically designed for the task. We argue that our model can give adequate representation of the history, and therefore can naturally exploit both the short and long range dependencies. Our model is fast, easy to train, and readily parallelized. Our extensive experiments on text generation and $n$-best re-ranking in machine translation show that $gen$CNN outperforms the state-of-the-arts with big margins.

研究动机与目标

  • 为解决 RNN 和 LSTM 在建模长距离依赖关系时因贪婪隐藏状态汇总而导致的效率低下问题。
  • 克服前馈网络在捕捉局部语言结构与长距离相关性方面的低效性。
  • 设计一种卷积架构,有效融合序列数据中的局部与全局依赖关系,以提升语言建模与生成性能。
  • 开发一种比循环架构更快、更易训练且高度可并行化的模型。
  • 在机器翻译任务的词序列预测与 n-best 重排序中展示优越性能。

提出的方法

  • 该模型采用由 $\alpha$ CNN(用于近期历史)和 $\beta$ CNN(用于较早历史)组成的递归架构,实现可变长度上下文建模。
  • 在 $\alpha$ CNN 中引入一种新颖的参数共享策略,实现在时间步之间的部分共享,从而保留时间结构。
  • 引入卷积门控机制,以动态控制信息流,增强表征学习能力。
  • 通过交替使用卷积层与池化层,并引入外部门控机制,实现有效的特征抽象。
  • 最终表示通过全连接层和软最大层传递,以预测下一个词的概率。
  • 模型通过在词预测任务上使用交叉熵损失进行端到端训练,无循环结构或固定长度编码。

实验结果

研究问题

  • RQ1卷积架构是否能在无循环结构的前提下,有效建模词序列中的局部与长距离依赖关系?
  • RQ2$gen$CNN 是否在困惑度与生成质量方面优于基于 RNN 和前馈神经网络的语言模型?
  • RQ3$gen$CNN 在多大程度上能够保持序列中的长距离相关性,以条件概率随距离衰减程度衡量?
  • RQ4$gen$CNN 是否能在神经机器翻译的 n-best 重排序中优于现有语言模型?
  • RQ5$gen$CNN 的递归多尺度设计在多大程度上提升了训练效率与并行化能力?

主要发现

  • 在 FBIS 数据集上,$gen$CNN 的测试困惑度达到 181.2,显著优于次优模型(LSTM 为 206.9)。
  • 在 NIST MT2008 测试集上,$gen$CNN 在 n-best 重排序中的 BLEU 分数提升至 32.50,超过基线模型(31.11)与基于 LSTM 的重排序(31.90)。
  • 在 MT2006 与 MT2008 的平均 BLEU 分数达到 36.63,比基线高出 1.76 个 BLEU 点。
  • 一个词对预测概率的影响随距离缓慢衰减,表明其在长距离依赖建模方面表现强劲,即使在 40 个词以外仍有效。
  • 由于其卷积与非循环结构,$gen$CNN 比 RNN 和 LSTM 更快且更易于并行化。
  • 在动态评估中,$gen$CNN 比 RNN 和 LSTM 更有效地降低困惑度,展现出更优越的语言建模能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。