Skip to main content
QUICK REVIEW

[论文解读] End-to-End Spoken Language Understanding using RNN-Transducer ASR.

Anirudh Raju, Gautam Tiwari|arXiv (Cornell University)|Jun 30, 2021
Speech Recognition and Synthesis参考文献 31被引用 5
一句话总结

本文提出了一种端到端语音语言理解(SLU)系统,通过可微分神经接口将循环神经网络转换器(RNNT)自动语音识别(ASR)模型与神经网络NLU模型联合训练,实现通过多任务损失和语义序列损失的联合优化。该方法在公开和专有SLU数据集上的表现优于传统的流水线式ASR-NLU系统以及直接的语音转语义模型,通过统一的端到端训练,同时提升了ASR和NLU指标。

ABSTRACT

We propose an end-to-end trained spoken language understanding (SLU) system that extracts transcripts, intents and slots from an input speech utterance. It consists of a streaming recurrent neural network transducer (RNNT) based automatic speech recognition (ASR) model connected to a neural natural language understanding (NLU) model through a neural interface. This interface allows for end-to-end training using multi-task RNNT and NLU losses. Additionally, we introduce semantic sequence loss training for the joint RNNT-NLU system that allows direct optimization of non-differentiable SLU metrics. This end-to-end SLU model paradigm can leverage state-of-the-art advancements and pretrained models in both ASR and NLU research communities, outperforming recently proposed direct speech-to-semantics models, and conventional pipelined ASR and NLU systems. We show that this method improves both ASR and NLU metrics on both public SLU datasets and large proprietary datasets.

研究动机与目标

  • 为克服流水线式ASR与NLU系统存在的误差传播问题以及缺乏联合优化的局限性。
  • 通过可微分神经接口整合ASR与NLU组件,实现SLU的端到端训练。
  • 通过引入语义序列损失,直接优化不可微分的SLU评估指标(如意图准确率与槽位F1值),提升其性能。
  • 通过在统一框架中结合ASR与NLU研究领域的先进预训练模型,充分利用两者的技术进展。
  • 在多样化的SLU基准上,证明所提出的端到端范式在性能上优于传统流水线系统与直接的语音转语义模型。

提出的方法

  • 系统采用流式循环神经网络转换器(RNNT)作为ASR组件,将原始语音输入转换为文本转录。
  • 神经网络自然语言理解(NLU)模型处理RNNT生成的转录文本,以预测意图和槽位标签。
  • 可微分神经接口连接RNNT与NLU组件,支持两个模块之间的端到端反向传播。
  • 采用多任务训练策略,同时使用RNNT损失(用于ASR)和NLU损失(用于意图与槽位预测),以联合优化两个模块。
  • 引入语义序列损失,以直接优化意图准确率与槽位F1等不可微分的SLU评估指标。
  • 通过ASR损失、NLU损失与语义序列损失的组合,对联合模型进行端到端训练,实现语音理解的统一优化。

实验结果

研究问题

  • RQ1能否通过整合ASR与NLU组件的联合端到端SLU系统,在ASR与NLU指标上均优于传统的流水线式ASR-NLU系统?
  • RQ2ASR与NLU之间使用可微分神经接口,是否能有效支持端到端训练并带来性能提升?
  • RQ3引入语义序列损失是否能改善对意图准确率与槽位F1等不可微分SLU评估指标的优化?
  • RQ4该联合模型在多大程度上能够利用来自ASR与NLU研究社区的最先进预训练模型?
  • RQ5所提出的端到端范式在公开与大规模专有SLU数据集上是否具备良好的泛化能力?

主要发现

  • 所提出的端到端SLU系统在公开SLU数据集上,性能优于传统的流水线式ASR-NLU系统与直接的语音转语义模型。
  • 通过多任务损失与语义序列损失的联合训练,显著提升了ASR与NLU指标。
  • 系统通过在统一框架中整合预训练模型,有效利用了ASR与NLU领域的最先进技术。
  • 语义序列损失实现了对不可微分SLU评估指标的直接优化,使模型性能更贴近真实应用场景。
  • 该方法在公开基准与大规模专有数据集上均表现出一致的性能提升,显示出强大的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。