Skip to main content
QUICK REVIEW

[论文解读] Tie Your Embeddings Down: Cross-Modal Latent Spaces for End-to-end Spoken Language Understanding

Bhuvan Agrawal, Markus Müller|arXiv (Cornell University)|Nov 18, 2020
Speech Recognition and Synthesis被引用 8
一句话总结

本文提出了一种跨模态潜在空间(CMLS)架构,通过显式的损失函数对齐声学与文本嵌入,并利用BERT提供语义引导。三元组损失优于L2损失和先前的CMLS方法,在两个端到端语音语言理解(E2E SLU)数据集上分别实现了1.4%和4%的相对性能提升,尤其在复杂、低资源数据上显著提升了泛化能力。

ABSTRACT

End-to-end (E2E) spoken language understanding (SLU) systems can infer the semantics of a spoken utterance directly from an audio signal. However, training an E2E system remains a challenge, largely due to the scarcity of paired audio-semantics data. In this paper, we treat an E2E system as a multi-modal model, with audio and text functioning as its two modalities, and use a cross-modal latent space (CMLS) architecture, where a shared latent space is learned between the `acoustic' and `text' embeddings. We propose using different multi-modal losses to explicitly guide the acoustic embeddings to be closer to the text embeddings, obtained from a semantically powerful pre-trained BERT model. We train the CMLS model on two publicly available E2E datasets, across different cross-modal losses and show that our proposed triplet loss function achieves the best performance. It achieves a relative improvement of 1.4% and 4% respectively over an E2E model without a cross-modal space and a relative improvement of 0.7% and 1% over a previously published CMLS model using $L_2$ loss. The gains are higher for a smaller, more complicated E2E dataset, demonstrating the efficacy of using an efficient cross-modal loss function, especially when there is limited E2E training data available.

研究动机与目标

  • 为解决端到端语音语言理解(E2E SLU)中配对音频-语义数据有限的挑战,通过跨模态学习进行改进。
  • 通过在共享潜在空间中对齐声学与文本嵌入,提升低资源E2E SLU中的语义泛化能力。
  • 评估不同损失函数(L2、成对排序损失和三元组损失)在跨模态对齐嵌入方面的有效性。
  • 探究对抗性训练是否能进一步改善跨模态潜在空间中声学与文本嵌入之间的对齐。
  • 证明CMLS设置能够通过降低类内方差和误报率,实现更好的按意图聚类的声学嵌入。

提出的方法

  • 该模型使用跨模态潜在空间(CMLS)在声学与文本模态之间共享一个共同的嵌入空间,其中文本嵌入来自预训练的BERT模型。
  • 声学编码器通过多模态损失函数进行训练,以生成与基于BERT的文本嵌入接近的表示。
  • 评估了三种损失函数:L2损失、成对排序损失和三元组损失,其中后者显式地最小化正样本对之间的距离,同时最大化困难负样本对之间的距离。
  • 通过训练一个判别器来区分声学与文本嵌入,实施对抗性训练,迫使声学编码器生成更具文本特性的表示。
  • 模型在两个公开的E2E SLU数据集(SNIPS和ATIS)上进行训练,性能通过意图分类准确率和误报率进行衡量。
  • 使用t-SNE可视化分析潜在空间中声学嵌入的聚类质量,对比CMLS模型与基线模型。

实验结果

研究问题

  • RQ1使用带有显式损失函数的跨模态潜在空间是否能提升端到端语音语言理解性能,特别是在低资源数据集上?
  • RQ2在对齐声学与文本嵌入用于SLU时,L2、成对排序和三元组损失等不同多模态损失函数的表现如何比较?
  • RQ3对抗性训练是否能有效改善共享潜在空间中声学与文本嵌入之间的对齐?
  • RQ4CMLS模型是否能降低语义相反但声学相似的意图对(如'IncreaseBrightness'和'DecreaseBrightness')的误报率?
  • RQ5与无跨模态对齐的基线模型相比,CMLS模型的声学嵌入是否在按意图类别聚类方面表现更优,且类内方差更低?

主要发现

  • 三元组损失表现最佳,在SNIPS和ATIS数据集上分别相对于无跨模态空间的E2E模型实现了1.4%和4%的相对性能提升。
  • 三元组损失在复杂、低资源数据集上提升了泛化能力,且在更具挑战性的SNIPS数据集上提升更为显著。
  • CMLS模型将语义相反但声学相似的意图对(如'IncreaseBrightness'和'DecreaseBrightness')的误报率从基线的0.25降低至0.11。
  • t-SNE可视化显示,采用三元组损失的CMLS模型的声学嵌入在每种类别内形成更紧密、更清晰分离的聚类,表明类内方差更低。
  • 对抗性训练在性能上优于基线,但未超越三元组损失,表明在此设置下,基于显式损失的对齐比基于判别器的对齐更有效。
  • 结果表明,三元组损失更能捕捉语义差异,尤其在声学相似但语义相反的非目标样本上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。