[论文解读] ClovaCall: Korean Goal-Oriented Dialog Speech Corpus for Automatic Speech Recognition of Contact Centers
ClovaCall 提供了首个大规模韩语面向目标对话的语音语料库,包含来自真实餐厅预约电话的 60,746 对语音-文本配对。在 Deep Speech 2 和 LAS 模型上进行评估,显著提升了自动语音识别(ASR)性能,尤其是在使用通用领域数据预训练后进行微调时效果更佳,凸显了在客服中心应用中使用任务特定语料库的关键性。
Automatic speech recognition (ASR) via call is essential for various applications, including AI for contact center (AICC) services. Despite the advancement of ASR, however, most publicly available call-based speech corpora such as Switchboard are old-fashioned. Also, most existing call corpora are in English and mainly focus on open domain dialog or general scenarios such as audiobooks. Here we introduce a new large-scale Korean call-based speech corpus under a goal-oriented dialog scenario from more than 11,000 people, i.e., ClovaCall corpus. ClovaCall includes approximately 60,000 pairs of a short sentence and its corresponding spoken utterance in a restaurant reservation domain. We validate the effectiveness of our dataset with intensive experiments using two standard ASR models. Furthermore, we release our ClovaCall dataset and baseline source codes to be available via https://github.com/ClovaAI/ClovaCall.
研究动机与目标
- 为解决在客服中心应用中缺乏大规模、面向特定任务的韩语语音语料库的问题。
- 提供一个高质量、面向目标对话的数据集,专门针对韩语餐厅预约场景。
- 验证任务特定数据在提升真实世界 AICC(人工智能客服中心)服务中 ASR 性能方面的有效性。
- 通过发布公开可用、高质量的韩语语料库,支持低资源语言的 ASR 研究。
- 证明在通用领域数据上预训练后,再在任务特定数据上微调,其效果优于从零开始训练。
提出的方法
- ClovaCall 语料库从超过 11,000 名参与者处收集,他们在模拟餐厅预约电话中朗读预设的简短句子。
- 该数据集包含 60,746 对语音与转录文本,全部聚焦于单一面向目标的领域:餐厅预约。
- 通过使用简短、自然发生的问答对,语料库设计旨在最小化对齐和语音端点检测问题。
- 训练了两种标准 ASR 模型——Deep Speech 2(DS2)和 Listen, Attend and Spell(LAS)——采用三种训练方案:预训练-微调、从零开始训练,以及结合数据增强的从零开始训练。
- 预训练在 AIHub 通用领域韩语语料库上进行,随后在 ClovaCall 或更小的基于问答的通话语料库上进行微调。
- 应用了噪声增强(NA)和 SpecAugment(SA)等数据增强技术以评估鲁棒性,但由于录音本身已包含足够噪声,增益有限。

实验结果
研究问题
- RQ1与仅使用通用领域语料库相比,使用面向任务的、面向目标的韩语语音语料库是否能提升 ASR 性能?
- RQ2在类似 AIHub 的大型通用领域语料库上预训练后,再在较小的领域特定语料库(如 ClovaCall)上微调,是否能提升 ASR 性能?
- RQ3在 ClovaCall 上从零开始训练的 ASR 模型,与在通用领域数据上预训练后在 ClovaCall 上微调的模型相比,性能如何?
- RQ4数据增强技术在 ClovaCall 数据集上在多大程度上提升了 ASR 准确率?
- RQ5在 CER 和鲁棒性方面,ClovaCall 与现有其他韩语语音语料库(如 AIHub 和基于问答的通话数据集)相比表现如何?
主要发现
- 在通用领域 AIHub 语料库上预训练后,再在 ClovaCall 上微调,LAS 模型的词错误率(WER)降低至 8.0%,DS2 模型降低至 8.31%,显著优于从零开始训练的模型。
- 在 ClovaCall 上从零开始训练的 WER 分别为 DS2 的 11.4% 和 LAS 的 15.1%,表明任务特定数据对高性能至关重要。
- 在 AIHub 上预训练后,再在 ClovaCall 上微调,相比仅在 AIHub 上从零开始训练,LAS 模型的 WER 减少了 69.2%,DS2 模型减少了 59.5%。
- 基于问答的通话数据集在预训练-微调和从零开始训练两种方案下均优于 ClovaCall,可能是因为其测试集更大且词汇更广泛。
- 数据增强(NA 和 SA)带来的增益有限,表明录音本身已包含足够噪声,过度增强可能对较小模型(如 LAS)造成负面影响。
- 结果证实,面向目标对话系统中的 ASR,任务特定语料库至关重要,尤其在韩语等低资源语言中。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。