[论文解读] Measuring the Effectiveness of Voice Conversion on Speaker Identification and Automatic Speech Recognition Systems
本文评估了一种基于Cycle-GAN的语音转换(VC)系统在自动说话人识别(SID)系统中模仿目标说话人以及用于自动语音识别(ASR)训练数据增强的能力。尽管在SID系统中最高达到46%的top-1准确率,但将VC生成的合成数据加入ASR训练后,词错误率(WER)和字符错误率(CER)仅获得微小提升,表明尽管风格模仿能力很强,该方法在ASR数据增强方面仍存在局限性。
This paper evaluates the effectiveness of a Cycle-GAN based voice converter (VC) on four speaker identification (SID) systems and an automated speech recognition (ASR) system for various purposes. Audio samples converted by the VC model are classified by the SID systems as the intended target at up to 46% top-1 accuracy among more than 250 speakers. This encouraging result in imitating the target styles led us to investigate if converted (synthetic) samples can be used to improve ASR training. Unfortunately, adding synthetic data to the ASR training set only marginally improves word and character error rates. Our results indicate that even though VC models can successfully mimic the style of target speakers as measured by SID systems, improving ASR training with synthetic data from VC systems needs further research to establish its efficacy.
研究动机与目标
- 评估基于Cycle-GAN的语音转换是否能成功模仿目标说话人,以被自动说话人识别(SID)系统检测到。
- 研究合成语音转换数据是否能有效增强自动语音识别(ASR)系统的训练数据。
- 比较不同SID系统(i-vector与深度学习模型)在语音转换音频样本上的表现。
- 评估不同数量的VC生成合成数据对ASR模型错误率(WER与CER)的影响。
- 理解为何语音转换音频在SID中表现出高分类准确率,但在使用合成数据时ASR性能提升甚微。
提出的方法
- 使用在291名说话人上训练的基于Cycle-GAN的语音转换器,将源语音样本转换为目标说话人的风格,无需平行数据或文本转录。
- 采用四个独立的SID系统——两个基于i-vector,两个基于深度学习——对转换后的音频样本进行分类,以衡量模仿成功的程度。
- ASR系统基于Deep Speech 2架构,在Librispeech的train-clean-100数据集子集(16名说话人)上进行训练,使用真实语音和转换后的语音样本。
- 通过在选定的16名说话人间相互转换语音,生成合成数据,以增加内容多样性,同时保留语言内容。
- 训练集通过最多增加400%的合成数据进行增强,并在保留的测试集上使用WER和CER评估ASR性能。
- 比较两种评估场景:直接在真实测试语音上进行推理,以及先将测试语音转换为目标训练说话人风格后再进行推理。
实验结果
研究问题
- RQ1基于Cycle-GAN的语音转换器能否在自动说话人识别(SID)系统中成功模仿目标说话人?
- RQ2将语音转换数据用作训练数据增强时,能在多大程度上提升自动语音识别(ASR)模型的性能?
- RQ3不同SID系统架构(i-vector与深度学习)对语音转换音频样本的响应有何差异?
- RQ4ASR模型在使用合成语音转换数据训练时,其性能是否随合成数据量的增加而持续提升?
- RQ5为何语音转换音频在SID中表现出高分类准确率,却未能带来显著的ASR性能提升?
主要发现
- 语音转换器在291名候选说话人中,对转换后语音样本的top-1分类准确率最高达到46%,表明其具有强大的风格模仿能力。
- 某些SID系统中top-10准确率超过70%,表明在多种自动分类器下均能保持一致的模仿效果。
- 基于深度学习的SID模型比i-vector模型更频繁地将转换后的语音分类为目标说话人,表明其可能对细微的声学失真更敏感。
- 将合成语音转换数据加入ASR训练集后,词错误率(WER)和字符错误率(CER)仅获得微小提升,且当合成数据超过100%时增益即消失。
- 当在ASR推理前先将测试语音转换为目标训练说话人风格时,错误率显著高于直接推理,表明“先转换后推理”方法无效。
- 结果表明,尽管SID分类准确率较高,但合成语音转换数据对ASR训练并无显著益处,提示需进一步研究合成数据质量与模型对齐问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。