[论文解读] Data Augmenting Contrastive Learning of Speech Representations in the Time Domain
本文提出 WavAugment,一种用于 CPC 基于语音表示学习的时域数据增强库,表明仅过去时域增强与独立的 past/future 增强可显著提升性能,在 Libri-light 上获得 18-22% 相对提升,在 Zero Speech(数据量更大时)取得具有竞争力的结果,并在低资源语音识别中的音素分类也显示出增益。
Contrastive Predictive Coding (CPC), based on predicting future segments of speech based on past segments is emerging as a powerful algorithm for representation learning of speech signal. However, it still under-performs other methods on unsupervised evaluation benchmarks. Here, we introduce WavAugment, a time-domain data augmentation library and find that applying augmentation in the past is generally more efficient and yields better performances than other methods. We find that a combination of pitch modification, additive noise and reverberation substantially increase the performance of CPC (relative improvement of 18-22%), beating the reference Libri-light results with 600 times less data. Using an out-of-domain dataset, time-domain data augmentation can push CPC to be on par with the state of the art on the Zero Speech Benchmark 2017. We also show that time-domain data augmentation consistently improves downstream limited-supervision phoneme classification tasks by a factor of 12-15% relative.
研究动机与目标
- 研究时域数据增强对 CPC 基于语音表示学习的影响。
- 评估哪些增强策略(过去为主 vs 过去+未来)能带来最佳改进。
- 将发现扩展到法语与普通话的 Zero Speech 基准,以及有限监督的音素分类任务。
提出的方法
- 使用 CPC2 架构,包含一个编码器、上下文网络和多头预测器,以学习对未来语音片段的预测表示。
- 引入 WavAugment,这是一个基于 libsox 的时域增强库,在数据加载时即时进行增强。
- 在 CPC 训练中对 past 和/或 future 段应用增强调制,包括音高、叠加噪声、混响、带抑制、以及 tdrop 等。
- 使用 Libri-light ABX 指标评估无监督表示学习在同 speaker 与跨 speaker 设置下的表现。
- 将实验扩展到英语、法语和普通话的 ZeroSpeech 2017 基准,结合域内与域外训练数据。
- 通过对 CPC 特征进行有限标注数据的微调,评估半监督提升效果。
实验结果
研究问题
- RQ1时域增强如何影响基于 CPC 的语音表示学习?
- RQ2哪种增强策略(仅 past vs past+future)能最显著提升无监督与半监督语音任务?
- RQ3时域增强能否在不同语言(英语、法语、普通话)间泛化,并支持有限监督任务?
主要发现
- 数据增强在 Libri-light 上相对于未增强的 CPC 特征实现 18-22% 的相对改进。
- 音高和叠加噪声在英语、普通话和法语的 CPC 中最有效。
- 过去为主的增强或独立的 past/future 增强在大多数增强下表现优于其他替代方案;带抑制(bandrej)不利且被剔除。
- CPC2+WavAug 在 Libri-light 的同一说话人与跨说话人 ABX 测试中均优于 CPC2(在干净与其他条件下)。
- 在域外训练数据条件下,CPC2+WavAug 在某些设置中达到或超越 ZeroSpeech 2017 的_STATE-OF-THE-ART 基线,但只有在更大训练集下才实现数据高效。
- 数据增强在半监督音素分类中带来显著提升(相对 12-15%),在显著较小的标注数据预算下甚至可超越大型预训练基线。
- 时域增强(音高和噪声)在 CPC 训练中可以超过常见的频谱域增强(如 SpecAugment)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。