Skip to main content
QUICK REVIEW

[论文解读] ASCEND: A Spontaneous Chinese-English Dataset for Code-switching in Multi-turn Conversation

Holy Lovenia, Samuel Cahyawijaya|arXiv (Cornell University)|Dec 12, 2021
Speech and dialogue systems被引用 12
一句话总结

本论文介绍了ASCEND,这是一个从香港的多轮对话中收集的10.62小时自发性普通话-英语代码切换语音语料库,涵盖23位双语说话人,其方言和熟练程度各不相同。在ASCEND上微调预训练的wav2vec 2.0模型后,最佳性能达到22.69%的字符错误率(CER)和27.05%的混合错误率(MER)。由于词汇对齐更优且语言分布匹配更佳,中文预训练模型的表现优于英语和多语言模型。

ABSTRACT

Code-switching is a speech phenomenon occurring when a speaker switches language during a conversation. Despite the spontaneous nature of code-switching in conversational spoken language, most existing works collect code-switching data from read speech instead of spontaneous speech. ASCEND (A Spontaneous Chinese-English Dataset) is a high-quality Mandarin Chinese-English code-switching corpus built on spontaneous multi-turn conversational dialogue sources collected in Hong Kong. We report ASCEND's design and procedure for collecting the speech data, including annotations. ASCEND consists of 10.62 hours of clean speech, collected from 23 bilingual speakers of Chinese and English. Furthermore, we conduct baseline experiments using pre-trained wav2vec 2.0 models, achieving a best performance of 22.69\% character error rate and 27.05% mixed error rate.

研究动机与目标

  • 为解决低资源环境下中文-英语双语语音中高质量、自发性代码切换语音数据的缺乏问题,特别是针对中文-英语双语语音。
  • 构建一个多样化、均衡且具有代表性的自发性多轮对话语料库,真实反映香港地区的代码切换模式。
  • 利用预训练模型建立代码切换语音自动语音识别(ASR)的强基线性能。
  • 评估预训练语言选择(中文、英文、多语言)对代码切换ASR性能的影响。

提出的方法

  • 数据收集包括26个自发对话会话,涉及23位来自香港、台湾和中国大陆的双语说话人,涵盖多种话题和熟练程度。
  • 语料库按8:1:1的比例划分为训练、验证和测试集,性别分布均衡,并对句间和句内代码切换进行了标注。
  • 使用Adam优化器在单个GPU上对预训练的wav2vec 2.0模型(中文、英文、多语言)进行微调,损失函数为CTC损失。
  • 训练期间对音频数据应用时间掩码和频率掩码,未使用时间扭曲。
  • 模型评估采用字符错误率(CER)和混合错误率(MER),其中MER计算方式为:中文部分采用CER,英文部分采用WER。

实验结果

研究问题

  • RQ1在自发性中英代码切换语料库上微调预训练的wav2vec 2.0模型时,其性能如何变化?
  • RQ2预训练语言(中文 vs. 英文 vs. 多语言)对代码切换ASR性能有何影响?
  • RQ3预训练模型与语料库之间的语言分布和词汇重叠程度如何影响ASR准确率?
  • RQ4与朗读语音基线相比,使用自发语音数据在多大程度上能提升代码切换ASR性能?

主要发现

  • 中文预训练的wav2vec 2.0模型在测试集上表现最佳,CER为22.69%,MER为27.05%,优于英语和多语言模型。
  • 中文预训练模型收敛速度优于英语模型,尽管初始收敛速度慢于多语言模型,但最终性能更优。
  • 多语言预训练模型更早达到性能平台期,结果更差(MER为29.35%,CER为24.31%),低于中文预训练模型。
  • 中文预训练模型表现更优的原因在于其与ASCEND语料库的词汇重叠度更高,且约50%的语料为中文,与模型的预训练分布更匹配。
  • ASCEND在规模和语言多样性方面与现有中英代码切换数据集(如CECOS和SEAME)相当,验证了其在低资源ASR研究中的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。