Skip to main content
QUICK REVIEW

[论文解读] One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling

Ciprian Chelba, Tomáš Mikolov|arXiv (Cornell University)|Dec 10, 2013
Natural Language Processing Techniques被引用 6
一句话总结

本文引入了一个包含10亿词的基准语料库,以标准化统计语言模型技术的评估。它评估了多种模型,包括循环神经网络(RNNs),相较于基线的Kneser-Ney 5-gram模型,实现了35%的困惑度降低——相当于交叉熵减少10%——证明了深度学习在大规模语言建模中的有效性。

ABSTRACT

We propose a new benchmark corpus to be used for measuring progress in statistical language modeling. With almost one billion words of training data, we hope this benchmark will be useful to quickly evaluate novel language modeling techniques, and to compare their contribution when combined with other advanced techniques. We show performance of several well-known types of language models, with the best results achieved with a recurrent neural network based language model. The baseline unpruned Kneser-Ney 5-gram model achieves perplexity 67.6; a combination of techniques leads to 35% reduction in perplexity, or 10% reduction in cross-entropy (bits), over that baseline. The benchmark is available as a code.google.com project; besides the scripts needed to rebuild the training/held-out data, it also makes available log-probability values for each word in each of ten held-out data sets, for each of the baseline n-gram models.

研究动机与目标

  • 建立一个标准化的、公开可用的基准,用于评估统计语言模型技术。
  • 通过使用大规模真实语料库,实现新颖语言建模方法的公平、可复现且可扩展的比较。
  • 在大规模数据集上展示先进模型(尤其是RNNs)的性能提升,且数据预处理极少。
  • 通过提供免费获取的数据和基线结果,降低研究人员的入门门槛。
  • 鼓励社区广泛采用该基准,以加速语言建模及其应用的发展。

提出的方法

  • 从WMT11数据集中公开获取的单语英文文本构建了10亿词的训练语料库,包括归一化、分词和去重处理。
  • 通过将数据划分为100个分区,保留其中一个用于测试,其余用于未来实验,构建了保留测试集。
  • 使用标准n-gram平滑技术,评估了多种基线语言模型:插值Kneser-Ney 5-gram、Katz 5-gram和Stupid Backoff。
  • 使用随机梯度下降训练了隐藏单元数为256、512和1024的深度循环神经网络语言模型(RNNs),学习率范围为0.05至0.001。
  • 通过线性插值组合多个模型,利用保留数据调优权重以优化困惑度。
  • 应用了CPU并行化、SIMD指令和输出参数压缩等优化技术,将训练时间缩短了20至50倍,使大规模RNN训练在数天内即可完成,而非数周。

实验结果

研究问题

  • RQ1一个包含10亿词的大规模语言建模基准如何提升语言建模研究的可复现性和可比性?
  • RQ2在大规模数据集上,将先进模型(如RNNs)与传统n-gram模型结合,能实现多大的性能提升?
  • RQ3不同神经网络架构(例如隐藏单元数不同的RNNs)在困惑度和训练效率方面如何比较?
  • RQ4并行化和参数压缩等优化技术在不使用GPU的标准硬件上,能在多大程度上实现大规模RNN的训练?
  • RQ5模型组合策略如何影响最终的困惑度?哪些模型对组合性能的贡献最为显著?

主要发现

  • 表现最佳的模型是包含1024个隐藏单元的循环神经网络在内的多个模型组合,其在测试集上的困惑度为51.3。
  • 基线插值Kneser-Ney 5-gram模型的困惑度为67.6,作为性能提升的主要参考点。
  • 通过模型组合实现了35%的困惑度降低,对应交叉熵(比特)减少10%,表明性能有显著提升。
  • 具有1024个隐藏单元的循环神经网络模型困惑度达到51.3,显著优于所有n-gram基线模型。
  • 尽管其独立性能较差,Stupid Backoff模型在最终模型组合中获得了相对较高的权重,表明其提供了互补信息。
  • 优化技术的应用使最大规模RNN模型的训练时间从数周缩短至约10天,使在标准硬件上进行大规模训练成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。