[论文解读] Character-Level Language Modeling with Hierarchical Recurrent Neural Networks
本文提出了一种分层循环神经网络(HRNN)用于字符级语言建模,结合字符级输入/输出与多时标RNN模块,以捕捉长期依赖关系。该模型仅使用2%的参数量,即实现了比Kneser-Ney 5-gram语言模型更低的困惑度,并在端到端语音识别中,以比标准RNN少30%的参数量提升了准确率。
Recurrent neural network (RNN) based character-level language models (CLMs) are extremely useful for modeling out-of-vocabulary words by nature. However, their performance is generally much worse than the word-level language models (WLMs), since CLMs need to consider longer history of tokens to properly predict the next one. We address this problem by proposing hierarchical RNN architectures, which consist of multiple modules with different timescales. Despite the multi-timescale structures, the input and output layers operate with the character-level clock, which allows the existing RNN CLM training approaches to be directly applicable without any modifications. Our CLM models show better perplexity than Kneser-Ney (KN) 5-gram WLMs on the One Billion Word Benchmark with only 2% of parameters. Also, we present real-time character-level end-to-end speech recognition examples on the Wall Street Journal (WSJ) corpus, where replacing traditional mono-clock RNN CLMs with the proposed models results in better recognition accuracies even though the number of parameters are reduced to 30%.
研究动机与目标
- 为解决字符级语言模型(CLMs)相较于词级模型(WLMs)性能较差的问题,原因在于其需要更长的上下文依赖。
- 在不增加模型规模或偏离标准训练流程的前提下,使CLMs能够建模长期依赖关系。
- 在字符级框架内集成词级建模能力,以提升泛化能力并更好地处理 OOV(词汇表外)词。
- 在保持或提升基准任务性能的同时,显著减少模型参数量。
- 实现适用于端到端语音识别的实时、低资源字符级语言建模。
提出的方法
- 提出一种分层RNN架构,其中低层RNN在字符级别运行,高层RNN在词/句子边界级别运行,且使用不同的时钟频率。
- 整体模型采用字符级输入和输出,保持与现有RNN CLM训练方法的兼容性。
- 在低层和高层模块中均使用长短期记忆(LSTM)单元,以捕捉长期依赖关系。
- 使用标准交叉熵损失在字符序列上进行训练,高层RNN接收来自低层RNN的压缩嵌入表示。
- 在端到端语音识别中应用该模型,采用前缀树进行束搜索解码,保持实时推理能力。
- 使用词边界标记(<w>)和句子边界标记(<s>)作为高层RNN的同步信号。
实验结果
研究问题
- RQ1分层RNN架构是否可通过实现多时标处理来提升字符级语言建模性能?
- RQ2该模型是否能在显著减少参数量的前提下,实现优于传统n-gram模型的困惑度?
- RQ3尽管具有分层结构,该模型是否仍能与标准RNN训练流程保持兼容?
- RQ4该模型是否可有效应用于参数量减少的实时端到端语音识别?
- RQ5在字符级框架内整合词级抽象是否能改善对长程依赖关系的建模?
主要发现
- HLSTM-B 模型(4×1024 单元)在 One Billion Word Benchmark 上达到 60.7 的困惑度,优于 Kneser-Ney 5-gram 模型,尽管其参数量仅为后者的 2%。
- HLSTM-B(4×1024)模型在词级困惑度上达到 60.7,优于使用 11 亿个n-gram 的插值 Kneser-Ney 5-gram 模型的 67.6 困惑度。
- 在 WSJ Nov’92 20K 评估集上,将 4×1024 深层 LSTM 语言模型替换为所提出的 HLSTM-B(4×512)后,参数量减少至 30%,同时词错误率(WER)从 7.85% 降低至 7.78%。
- HLSTM-B(4×512)模型在词级困惑度上达到 73.6,WER 为 7.79%,仅使用 848 万个参数即展现出强劲性能。
- 在端到端自动语音识别中,语言模型困惑度与词错误率之间表现出强相关性,验证了其在实际应用中的有效性。
- 该模型与标准RNN CLM训练方法保持兼容,可直接使用现有训练配方而无需修改。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。