Skip to main content
QUICK REVIEW

[论文解读] Adapting Pretrained Transformer to Lattices for Spoken Language Understanding

Chao-Wei Huang, Yun-Nung Chen|arXiv (Cornell University)|Nov 2, 2020
Speech Recognition and Synthesis参考文献 16被引用 4
一句话总结

本文提出将预训练的变换器模型适配以处理自动语音识别(ASR)系统生成的词图输入,以提升语音语言理解(SLU)性能。通过引入词图可达性掩码和位置编码,该模型能有效编码多个ASR假设,在不同语音条件下的ATIS基准测试中,相较于1-best转录结果,实现了20.6%的相对错误率降低。

ABSTRACT

Lattices are compact representations that encode multiple hypotheses, such as speech recognition results or different word segmentations. It is shown that encoding lattices as opposed to 1-best results generated by automatic speech recognizer (ASR) boosts the performance of spoken language understanding (SLU). Recently, pretrained language models with the transformer architecture have achieved the state-of-the-art results on natural language understanding, but their ability of encoding lattices has not been explored. Therefore, this paper aims at adapting pretrained transformers to lattice inputs in order to perform understanding tasks specifically for spoken language. Our experiments on the benchmark ATIS dataset show that fine-tuning pretrained transformers with lattice inputs yields clear improvement over fine-tuning with 1-best results. Further evaluation demonstrates the effectiveness of our methods under different acoustic conditions. Our code is available at https://github.com/MiuLab/Lattice-SLU

研究动机与目标

  • 解决1-best ASR转录结果在语音语言理解(SLU)任务中的局限性,此类结果易受转录错误影响,从而降低下游自然语言理解(NLU)性能。
  • 探究预训练变换器模型——尽管在文本任务中表现优异——是否能有效编码来自ASR系统的不确定、图结构化的输入。
  • 开发一种方法,使变换器架构能够处理词图输入,同时保留其强大的归纳偏置与迁移学习能力。
  • 在不同语音条件下实现一致的性能提升,尤其在ASR质量较差时表现更优。
  • 探究模型在小样本数据下的样本效率及其对ASR错误率的鲁棒性,表明词图输入可减少对高质量转录的依赖。

提出的方法

  • 引入词图可达性掩码以表示词图的结构,使变换器仅能关注图中的有效路径。
  • 设计一种词图位置编码方案,基于图中节点的拓扑顺序分配位置嵌入,以保留结构上下文信息。
  • 使用词图输入而非1-best ASR输出,对预训练的GPT风格变换器进行SLU任务微调。
  • 在[CLS] token表示上使用线性分类器进行意图检测与槽位预测,并采用端到端微调。
  • 采用线性学习率预热策略,配合Adam优化器,训练5个周期,批量大小为8。
  • 评估两种变体:一种使用标准注意力机制,另一种使用词图感知注意力机制,两者均使用相同的掩码输入表示。

实验结果

研究问题

  • RQ1预训练变换器能否被有效适配以编码来自ASR系统的图结构化输入用于SLU任务?
  • RQ2与1-best转录结果相比,使用词图输入是否能在意图检测与槽位预测性能上带来可测量的提升?
  • RQ3当ASR词错误率较高时,模型性能在不同语音条件下的变化如何,特别是在高错误率条件下?
  • RQ4在有限数据上训练时,模型是否具备样本效率?是否需要更多样本才能从噪声较大的词图输入中学习?
  • RQ5与1-best转录结果相比,词图输入在多大程度上提升了对ASR错误的鲁棒性?

主要发现

  • 与1-best基线相比,使用词图输入微调预训练变换器在三种语音条件下,意图检测的相对错误率分别降低了32.4%、15.4%和20.6%。
  • 模型在所有语音条件下均表现出一致的性能提升,尤其在高词错误率(WER)条件下提升最为显著。
  • 即使将词图线性化为拓扑顺序,词图输入仍能提升性能,表明替代词形的存在有助于提升理解能力。
  • 在300至5,000个样本的全部训练数据规模下,模型始终比1-best基线保持2%的F1分数优势,表明其具备强大的样本效率。
  • 当WER超过15%时,基于词图的模型优于1-best模型,证实其对ASR质量较差情况具有更强的鲁棒性。
  • 定性分析表明,即使正确词汇(如“far”)在词图中出现概率较低,模型仍能正确识别意图,证明其有效利用了词图信息。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。