Skip to main content
QUICK REVIEW

[论文解读] Improving Code-switching Language Modeling with Artificially Generated Texts using Cycle-consistent Adversarial Networks

Chia-Yu Li, Ngoc Thang Vu|arXiv (Cornell University)|Dec 12, 2021
Speech Recognition and Synthesis被引用 4
一句话总结

本文提出了一种基于CycleGAN的框架,将代码混用视为一种说话风格,通过单语句句生成人工代码混用文本,显著提升了SEAME语料库上的语言建模和自动语音识别(ASR)性能。通过在无平行数据的情况下采用循环一致性对抗训练,该模型生成了更自然、语言上一致的代码混用文本,能够模仿真实的语音模式,包括结巴和混合语言分布。

ABSTRACT

This paper presents our latest effort on improving Code-switching language models that suffer from data scarcity. We investigate methods to augment Code-switching training text data by artificially generating them. Concretely, we propose a cycle-consistent adversarial networks based framework to transfer monolingual text into Code-switching text, considering Code-switching as a speaking style. Our experimental results on the SEAME corpus show that utilising artificially generated Code-switching text data improves consistently the language model as well as the automatic speech recognition performance.

研究动机与目标

  • 通过生成合成训练数据来解决代码混用语言建模中的数据稀缺问题。
  • 通过数据增强提升代码混用语音的自动语音识别(ASR)性能。
  • 将代码混用建模为一种说话风格而非翻译任务,以实现端到端学习。
  • 生成更自然且语言上一致的代码混用文本,以模仿真实的语音模式,包括流利度和语调。
  • 评估循环一致性对抗训练对语言建模和ASR性能的影响。

提出的方法

  • 该框架使用序列到序列(S2S)模型预训练单语句到代码混用的翻译映射。
  • 采用CycleGAN通过循环一致性对抗训练将单语句文本转换为代码混用文本,无需使用单语句-代码混用的平行对。
  • 该模型采用两个生成器(G:单语句 → 代码混用,F:代码混用 → 单语句)和两个判别器,以强制实现分布相似性和循环一致性。
  • 训练目标结合了对抗损失、循环一致性损失和身份损失,以保持语义意义并提升生成质量。
  • 利用单语料料预训练S2S模型,随后在CycleGAN框架内进行微调,以改善风格迁移。
  • 该框架在SEAME语料库上进行评估,与基线模型对比生成文本的分布和ASR性能。
Figure 1: Network architecture of CycleGAN for CS text generation. X refers to monolingual text, e.g. Chinese and Y refers to CS text, e.g. Chinese English CS sentences.
Figure 1: Network architecture of CycleGAN for CS text generation. X refers to monolingual text, e.g. Chinese and Y refers to CS text, e.g. Chinese English CS sentences.

实验结果

研究问题

  • RQ1代码混用能否被有效建模为一种说话风格以生成合成训练数据?
  • RQ2与基线和S2S方法相比,基于CycleGAN的文本生成是否能降低语言建模困惑度?
  • RQ3人工生成的代码混用文本能否提升真实世界数据上的自动语音识别(ASR)性能?
  • RQ4生成的文本在多大程度上匹配真实代码混用语音的语言分布(如代码混用程度)?
  • RQ5该模型在多大程度上能模拟自然语音行为,如结巴或重复?

主要发现

  • 基于CycleGAN的模型在ASR评估集上取得了21.9%的词错误率(WER),优于基线(22.4%)和S2S模型(22.1%),表明ASR性能持续提升。
  • 使用CycleGAN生成的数据,语言建模困惑度降低至10.39,无论循环损失权重如何,均优于基线和S2S模型。
  • CycleGAN生成文本中的代码混用强度(CMI)分布与真实SEAME语料库高度一致,尤其在(30,45]%和(45,50]%的CMI区间。
  • CycleGAN生成的文本表现出自然的语音行为,如重复(例如“take take”)和语义转换(例如将“logistics”替换为“2016”),表明其成功模仿了真实说话风格。
  • 该模型成功生成了语义上连贯的代码混用句子,在保留语义内容的同时引入了自然的代码混用模式,而非简单的词典替换。
  • 消融实验表明,循环一致性损失至关重要:当λ₁ = 0.9时性能最优,词错误率(MER)为10.77%,表明循环损失有助于稳定生成过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。