[论文解读] From Audio to Semantics: Approaches to end-to-end spoken language understanding
本文提出端到端的序列到序列模型,联合优化自动语音识别(ASR)与自然语言理解(NLU),以实现语音语言理解(SLU),输入为音频。通过引入中间文本表示并进行联合训练,最佳模型相较独立训练在参数词错误率(WER)上相对降低18%,同时在领域和意图预测的F1分数上保持一致或更优。
Conventional spoken language understanding systems consist of two main components: an automatic speech recognition module that converts audio to a transcript, and a natural language understanding module that transforms the resulting text (or top N hypotheses) into a set of domains, intents, and arguments. These modules are typically optimized independently. In this paper, we formulate audio to semantic understanding as a sequence-to-sequence problem [1]. We propose and compare various encoder-decoder based approaches that optimize both modules jointly, in an end-to-end manner. Evaluations on a real-world task show that 1) having an intermediate text representation is crucial for the quality of the predicted semantics, especially the intent arguments and 2) jointly optimizing the full system improves overall accuracy of prediction. Compared to independently trained models, our best jointly trained model achieves similar domain and intent prediction F1 scores, but improves argument word error rate by 18% relative.
研究动机与目标
- 为解决传统SLU系统中ASR与NLU模块独立训练导致的性能欠佳问题,包括错误传播与优化目标不一致。
- 探究端到端序列到序列模型是否能从原始音频中联合优化ASR与NLU,以提升语义预测准确性。
- 评估中间文本表示与联合训练对SLU中意图与参数预测质量的影响。
- 在真实世界SLU数据上比较不同训练策略——基线、多任务、多阶段与联合训练——以识别最有效的模型架构。
- 评估端到端模型是否能超越传统流水线方法(使用CFG解析器处理ASR转录文本进行语义标注)的性能。
提出的方法
- 将SLU建模为序列到序列问题,编码器处理原始音频,解码器直接生成领域、意图与参数预测结果。
- 采用基于注意力机制的编码器-解码器架构,共享编码器与特定任务的解码器,以建模音频与语义输出之间的对齐关系。
- 实施多阶段训练策略:模型首先预测文本转录,再利用这些转录结果预测语义,最后进行联合优化。
- 在多阶段模型中应用采样softmax,以提升训练效率并减少序列生成过程中的错误传播。
- 使用交叉熵损失进行模型训练,联合优化ASR与NLU目标,使转录准确性与语义相关性对齐。
- 对模型生成的转录文本使用CFG解析器生成类似真实标签的语义标签,用于评估,从而实现与标准NLU流水线的对比。
实验结果
研究问题
- RQ1与独立训练的模型相比,从音频中联合端到端训练ASR与NLU是否能提升语义预测准确性?
- RQ2在端到端SLU系统中,中间文本表示是否对高质量语义预测是必需的?
- RQ3联合优化如何影响参数词错误率(WER),特别是与标准ASR-NLU流水线相比?
- RQ4在仅使用有限NLU数据进行训练的情况下,端到端模型是否仍能在使用CFG解析器处理其ASR输出时保持竞争力?
- RQ5在WER、F1分数与语义准确性方面,不同训练策略(基线、多任务、多阶段与联合)之间的表现如何比较?
主要发现
- 最佳联合训练模型相较独立训练模型,在参数词错误率(WER)上实现18%的相对提升,同时保持与之相当的领域与意图F1分数。
- 联合优化显著降低了参数预测的WER,其中多阶段(采样softmax)模型达到11.26%的WER,相较基线绝对提升0.6%。
- 多任务模型取得最高的意图F1分数97.2,较基线提升1.3分,证明了联合学习的优势。
- 即使在使用模型生成的转录文本并配合CFG解析器时,联合训练模型在意图F1与参数WER上仍优于独立训练模型,表明其ASR质量更优。
- 直接从音频预测语义而无中间转录表示的模型,性能劣于包含中间文本表示的模型,证实了中间表示的重要性。
- 联合训练策略使ASR组件能够学习更契合语义目标的转录模式,从而减少对意图与参数预测最为关键的错误。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。