Skip to main content
QUICK REVIEW

[论文解读] Scaling Recurrent Neural Network Language Models

Will Williams, Niranjani Prasad|arXiv (Cornell University)|Feb 2, 2015
Topic Modeling参考文献 10被引用 13
一句话总结

本论文表明,在GPU上训练的大规模循环神经网络语言模型(RNNLM)相比n-gram模型实现了显著更低的困惑度,其中最大规模的RNNLM(nstate 4096)在Billion Word Benchmark上达到了42.4的新SOTA困惑度。该模型在自动语音识别(ASR)中将词错误率降低了18%,在机器翻译中BLEU得分提升1分,并在词预测任务中实现了17%的相对命中率提升,证明RNNLM在计算成本更高的情况下仍能有效扩展并超越n-gram模型。

ABSTRACT

This paper investigates the scaling properties of Recurrent Neural Network Language Models (RNNLMs). We discuss how to train very large RNNs on GPUs and address the questions of how RNNLMs scale with respect to model size, training-set size, computational costs and memory. Our analysis shows that despite being more costly to train, RNNLMs obtain much lower perplexities on standard benchmarks than n-gram models. We train the largest known RNNs and present relative word error rates gains of 18% on an ASR task. We also present the new lowest perplexities on the recently released billion word language modelling benchmark, 1 BLEU point gain on machine translation and a 17% relative hit rate gain in word prediction.

研究动机与目标

  • 研究RNNLM在模型大小、训练数据量、计算成本和内存使用方面如何扩展。
  • 克服以往因计算和内存需求过高而导致大规模RNN训练受限的历史问题。
  • 证明RNNLM在标准基准测试中可实现显著低于n-gram模型的困惑度。
  • 评估大规模RNNLM在自动语音识别(ASR)、机器翻译(MT)和移动设备词预测等实际应用中的性能。
  • 证明通过数据并行化和内存优化技术,RNNLM可在GPU上高效训练,从而在参数量少于以往模型的情况下实现SOTA性能。

提出的方法

  • 在包含新闻转录、Wikipedia和网络爬取新闻的80亿词复合语料上训练RNNLM,采用基于GPU的训练方式并结合数据并行化。
  • 使用16个句子的滚动缓冲区进行熵过滤,以保留句间上下文的同时去除低质量文本,从而在不进行句子级别过滤的情况下维持语料质量。
  • 采用64k词表的RNNLM,并与完整的770K词表5-gram模型进行插值,以处理Billion Word Benchmark中的罕见词。
  • 应用模型压缩技术,包括权重共享(输入到隐藏层与隐藏到输出层互为转置)、8位量化和残差连接,将模型大小压缩至10 MB,适用于移动设备词预测。
  • 使用一种高效的内部工具对ASR的解码网格进行重打分,实现在基于Kaldi系统上的大RNNLM实时推理。
  • 训练隐藏状态大小从256到4096逐步增加的RNNLM,并在多个基准上测量困惑度、词错误率(WER)、BLEU和命中率。

实验结果

研究问题

  • RQ1RNNLM在模型大小和训练数据量方面如何影响困惑度的降低?
  • RQ2尽管存在高内存和计算需求,大规模RNNLM是否能在GPU上高效训练?
  • RQ3RNNLM在多种NLP任务中是否在困惑度、WER、BLEU和命中率方面均优于n-gram模型?
  • RQ4RNNLM是否可以被充分压缩,以在内存受限的环境(如移动设备)中运行,同时保持性能提升?
  • RQ5n-gram模型的性能上限是什么?RNNLM是否能在所有数据规模下超越它?

主要发现

  • nstate 4096的RNNLM在Billion Word Benchmark上达到42.4的困惑度,为当时报告的最低值,尽管仅使用了总参数量的3%,仍优于之前工作的插值模型。
  • RNNLM在ASR中将词错误率相比n-gram重打分相对降低了18%,在IWSLT14和en-US任务中展现出显著的实际影响。
  • 在机器翻译中,nstate 3520的RNNLM将BLEU分数从32.34提升至33.45,实现了1分的提升,证明其在ASR之外的应用价值。
  • 在移动词预测中,10 MB的8位量化RNNLM(nstate 1024)相比Katz-5-gram模型实现了17%的相对命中率提升,证明其在低内存环境下的有效性。
  • 最大规模的RNNLM相比5-gram模型困惑度降低了40%以上,作者得出结论:RNNLM在任何训练数据量下均能实现低于n-gram模型的困惑度。
  • 尽管计算和内存需求较高,但通过数据并行化和优化技术在GPU上训练RNNLM是可行的,并且在所有评估任务中均优于n-gram模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。