Skip to main content
QUICK REVIEW

[论文解读] Code-switched inspired losses for generic spoken dialog representations

Émile Chapuis, Pierre Colombo|arXiv (Cornell University)|Aug 27, 2021
Topic Modeling参考文献 103被引用 11
一句话总结

本文提出受代码混用启发的预训练损失,以学习通用的多语言语音对话表征,利用从 OpenSubtitles 自动构建的多语言对话数据。所提方法在单语和多语下游任务上显著提升性能,在多语言对话行为识别和跨语言话语检索的新基准上超越 mBERT 及其他基线模型。

ABSTRACT

Spoken dialog systems need to be able to handle both multiple languages and multilinguality inside a conversation ( extit{e.g} in case of code-switching). In this work, we introduce new pretraining losses tailored to learn multilingual spoken dialog representations. The goal of these losses is to expose the model to code-switched language. To scale up training, we automatically build a pretraining corpus composed of multilingual conversations in five different languages (French, Italian, English, German and Spanish) from exttt{OpenSubtitles}, a huge multilingual corpus composed of 24.3G tokens. We test the generic representations on exttt{MIAM}, a new benchmark composed of five dialog act corpora on the same aforementioned languages as well as on two novel multilingual downstream tasks ( extit{i.e} multilingual mask utterance retrieval and multilingual inconsistency identification). Our experiments show that our new code switched-inspired losses achieve a better performance in both monolingual and multilingual settings.

研究动机与目标

  • 解决现有模型在处理多语言和代码混用语音对话方面的局限性。
  • 开发显式建模话语层面代码混用的预训练目标,以提升多语言表征学习效果。
  • 利用来自 OpenSubtitles 的大规模自动构建的多语言对话语料进行预训练扩展。
  • 在新的多语言对话行为基准(MIAM)以及两项新提出的多语言任务(多语言掩码话语检索与不一致性识别)上评估所提方法。
  • 证明代码混用启发损失可提升单语和多语设置下的泛化能力。

提出的方法

  • 提出三种新颖的预训练目标:mMUG(多语言掩码话语生成)、mHR(多语言下一句话语检索)和 TMUG(时间多语言话语生成),灵感源自代码混用模式。
  • 通过利用五种语言(en, fr, de, es, it)之间的现有句子级对齐,自动构建大规模多语言对话语料。
  • 采用共享跨注意力机制的序列到序列架构,在单一编码器-解码器框架中建模跨语言上下文。
  • 应用分层掩码策略,即在多语言上下文中对来自不同语言的语句进行掩码与预测,以模拟代码混用行为。
  • 通过组合掩码话语预测、下一句话语检索和时间一致性目标联合训练模型,以捕捉跨语言的语篇级依赖关系。
  • 在单语和多语下游任务(包括对话行为分类与跨语言话语检索)上微调所得表征。

实验结果

研究问题

  • RQ1受代码混用启发的预训练损失是否能提升多语言设置下通用语音对话表征的质量?
  • RQ2在预训练阶段接触包含代码混用模式的多语言对话是否能提升在单语和多语下游任务上的表现?
  • RQ3来自 OpenSubtitles 的大规模自动构建的多语言对话语料是否能有效支持多语言对话理解的预训练?
  • RQ4结合多种多语言预训练目标是否能带来比单一目标更好的泛化性能?
  • RQ5所提损失在多语言新任务(如多语言掩码话语检索与不一致性检测)上的表现提升程度如何?

主要发现

  • 所提方法 mMUG+TMUG+MMUG 在多语言对话行为基准(MIAM)上表现最佳,德语测试集的 R@5 得分为 70.2%,较 mBERT 提升 4.1 个百分点。
  • 在多语言下一句话语检索(mNUR)任务中,最佳模型在英法跨语言设置下的 R@5 得分为 64.0%,较 mBERT 提升 6.1 个百分点。
  • 同时使用三种损失的模型(mMUG+TMUG+MMUG)在多语言不一致性检测任务上取得 68.3% 的 R@5 得分,展现出在不同语言对之间的强大泛化能力。
  • 该方法在所有单语和多语评估任务中均优于 mBERT 和 mBERT(4 层),在零样本和少样本设置下均表现出一致的性能提升。
  • 消融实验确认,结合全部三种损失可获得最佳性能,其中 TMUG 和 MMUG 对多语言理解与跨语言迁移有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。