[论文解读] Speech-language Pre-training for End-to-end Spoken Language Understanding
本文提出了一种统一的语音-语言预训练(SLP)框架,将预训练的自动语音识别(ASR)编码器与基于BERT的语言模型整合到单一的Transformer解码器中,实现端到端的口语理解。通过在有限的标注数据上联合微调,并采用条件掩码语言建模目标,该模型在意图分类和槽位填充任务上实现了最先进性能,且所需配对数据显著少于先前方法。
End-to-end (E2E) spoken language understanding (SLU) can infer semantics directly from speech signal without cascading an automatic speech recognizer (ASR) with a natural language understanding (NLU) module. However, paired utterance recordings and corresponding semantics may not always be available or sufficient to train an E2E SLU model in a real production environment. In this paper, we propose to unify a well-optimized E2E ASR encoder (speech) and a pre-trained language model encoder (language) into a transformer decoder. The unified speech-language pre-trained model (SLP) is continually enhanced on limited labeled data from a target domain by using a conditional masked language model (MLM) objective, and thus can effectively generate a sequence of intent, slot type, and slot value for given input speech in the inference. The experimental results on two public corpora show that our approach to E2E SLU is superior to the conventional cascaded method. It also outperforms the present state-of-the-art approaches to E2E SLU with much less paired data.
研究动机与目标
- 解决现实世界中端到端口语理解(E2E SLU)系统中语音-语义对标注数据不足的挑战。
- 通过利用预训练的语音和语言表征,在低资源SLU场景下提升泛化能力和性能。
- 将经过充分优化的ASR和NLU编码器统一为单一解码器架构,实现联合优化。
- 将槽位填充建模为基于上下文语音嵌入的条件序列到序列生成任务。
- 通过统一的预训练与微调策略,证明端到端SLU可在更少标注数据下超越级联系统。
提出的方法
- 将基于AED的预训练ASR编码器(语音)与基于BERT的语言模型编码器(语言)统一为单一的Transformer解码器架构。
- 在配对的语音与转录文本上,使用条件掩码语言建模(MLM)目标持续预训练统一模型。
- 在有限的标注数据上端到端微调SLP模型,从输入语音生成意图、槽位类型和槽位值的序列。
- 采用两阶段训练:首先在ASR转录文本上预训练,然后在语义标签上微调(两步),或直接在ASR+SLU目标组合上微调(一步)。
- 将ASR系统中原始语言模型解码器替换为BERT,以提升ASR假设质量,从而进一步提升下游SLU性能。
- 利用ASR编码器的语音嵌入与BERT的文本嵌入,在统一框架中联合优化语义表征。
实验结果
研究问题
- RQ1在标注数据有限的情况下,统一的语音-语言预训练框架是否能在端到端SLU中超越级联的ASR-NLU流水线?
- RQ2通过使用条件MLM目标联合预训练语音和语言编码器,是否能提升意图分类与槽位填充的性能?
- RQ3所提方法是否能在远少于现有方法的配对训练数据下,实现端到端SLU的最先进结果?
- RQ4一步法与两步法微调策略在低资源SLU数据集上的性能差异如何?
- RQ5预训练的语音与语言模型在多大程度上能降低ASR错误率并提升下游语义标注准确率?
主要发现
- 在FSC语料库上,所提出的端到端SLP模型在所有测试方法中实现了最高的意图准确率(99.13%),优于级联系统与先前的端到端方法。
- 在ATIS语料库上,经微调后,模型的槽位F1分数达到90.12%,显著优于基线级联系统(84.13%)。
- 仅使用FSC语料库中3,000个随机选取的训练样本,模型性能几乎与使用全部23,132个样本的完整训练集相当,展现出极强的数据效率。
- 预训练的SLP模型将ATIS数据集上的ASR词错误率(WER)从14.82%降至8.68%,将FSC数据集上的WER从2.82%降至0.42%,显著提升了转录质量。
- 在ATIS语料库上,两步训练策略(先在ASR上预训练,再在SLU上微调)优于一步微调,可能是因为ASR+SLU输出的总目标序列更长。
- 模型展现出卓越的泛化能力与鲁棒性,在FSC与ATIS两个数据集上均以极少的标注数据实现了最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。