[论文解读] Transformer Language Models with LSTM-based Cross-utterance Information Representation
该论文提出R-TLM,一种通过引入LSTM模块增强的Transformer语言模型,以改善自动语音识别中的跨话语上下文表征。通过在选定的Transformer模块中整合LSTM隐藏状态并采用分段递归机制,同时使用融合层实现残差连接,R-TLM在AMI、Eval2000和RT03数据集上相较单话语TLM实现0.9–0.8%的绝对WER降低,相较强健的跨话语基线模型实现0.5–0.2%的降低,显著性检验确认了性能提升。
The effective incorporation of cross-utterance information has the potential to improve language models (LMs) for automatic speech recognition (ASR). To extract more powerful and robust cross-utterance representations for the Transformer LM (TLM), this paper proposes the R-TLM which uses hidden states in a long short-term memory (LSTM) LM. To encode the cross-utterance information, the R-TLM incorporates an LSTM module together with a segment-wise recurrence in some of the Transformer blocks. In addition to the LSTM module output, a shortcut connection using a fusion layer that bypasses the LSTM module is also investigated. The proposed system was evaluated on the AMI meeting corpus, the Eval2000 and the RT03 telephone conversation evaluation sets. The best R-TLM achieved 0.9%, 0.6%, and 0.8% absolute WER reductions over the single-utterance TLM baseline, and 0.5%, 0.3%, 0.2% absolute WER reductions over a strong cross-utterance TLM baseline on the AMI evaluation set, Eval2000 and RT03 respectively. Improvements on Eval2000 and RT03 were further supported by significance tests. R-TLMs were found to have better LM scores on words where recognition errors are more likely to occur. The R-TLM WER can be further reduced by interpolation with an LSTM-LM.
研究动机与目标
- 提升Transformer语言模型在自动语音识别(ASR)任务中对跨话语上下文的建模能力。
- 解决标准TLM在稳健表征话语间长距离依赖关系方面的局限性,尤其针对罕见或易错词汇。
- 通过将LSTM隐藏状态整合到选择性Transformer模块中,探索LSTM与Transformer架构的互补优势。
- 在AMI、Eval2000和RT03等标准ASR基准数据集上评估所提出R-TLM结构的有效性。
- 探究将R-TLM与独立LSTM-LM结合是否可通过模型插值进一步降低WER。
提出的方法
- R-TLM架构将单层LSTM模块集成到部分Transformer模块中,实现在话语段之间的递归机制。
- LSTM模块在话语边界间保持隐藏状态,捕捉自注意力机制单独难以完全建模的长距离依赖关系。
- 引入融合层,通过捷径连接将LSTM输出与Transformer模块输入结合,保留梯度流动并增强表征学习能力。
- 采用来自Transformer-XL的分段递归机制,扩展上下文范围以超越单个话语,使模型能够关注先前的语段。
- 模型在大规模转录对话数据上端到端训练,通过LSTM状态和扩展的注意力范围显式编码跨话语上下文。
- 最终通过与外部LSTM-LM插值实现WER的进一步优化,结合两种架构的优势。
实验结果
研究问题
- RQ1在选定的Transformer模块中集成LSTM模块是否能改善语言模型在ASR任务中对跨话语上下文的表征?
- RQ2结合来自Transformer-XL的分段递归与基于LSTM的隐藏状态递归,是否能实现对长距离依赖关系更稳健的建模?
- RQ3与强健的TLM基线相比,R-TLM在标准评估集上的WER改进是否具有统计显著性?
- RQ4R-TLM是否能更好地建模罕见或易错词汇,表现为这些词汇的LM得分更低?
- RQ5通过将R-TLM与独立LSTM-LM插值,是否能进一步降低WER?
主要发现
- 在AMI、Eval2000和RT03评估集上,R-TLM相较单话语TLM基线分别实现了0.9%、0.6%和0.8%的绝对WER降低。
- 在相同数据集上,R-TLM相较强健的跨话语TLM基线实现了0.5%、0.3%和0.2%的绝对WER降低,且Eval2000和RT03的改进经显著性检验确认(p < 0.05)。
- R-TLM在易错词汇(即转录中被错误识别的词汇)上表现出更低的LM得分(语言建模效果更优),表明其对声学错误更具鲁棒性。
- 具有扩展历史的TLM(TLM XL)的困惑度(PPL)低于R-TLM,但WER更高,表明尽管PPL相近,R-TLM对罕见或易错词汇的建模更优。
- 采用融合层与分段递归的R-TLM(d-R-TLM XL)在RT03上实现了统计显著的WER改进(p = 0.001),证实了该方法的稳健性。
- 将R-TLM与LSTM-LM插值可进一步降低WER,在RT03上达到最低WER 11.8%,表明两种架构具有互补优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。