Skip to main content
QUICK REVIEW

[论文解读] Sampling strategies in Siamese Networks for unsupervised speech representation learning

Rachid Riad, Corentin Dancette|arXiv (Cornell University)|Apr 30, 2018
Speech Recognition and Synthesis被引用 14
一句话总结

本文研究了孪生网络在无监督语音表示学习中采样策略的影响,表明对词类频率进行压缩以及优化相同/不同词对的比例可显著提升语音的可区分性。所提出的采样策略在ZeroSpeech 2015基准上优于以往的神经网络方法,在弱监督下的子词表示学习中达到最先进性能,并能有效迁移到完全无监督设置中。

ABSTRACT

Recent studies have investigated siamese network architectures for learning invariant speech representations using same-different side information at the word level. Here we investigate systematically an often ignored component of siamese networks: the sampling procedure (how pairs of same vs. different tokens are selected). We show that sampling strategies taking into account Zipf's Law, the distribution of speakers and the proportions of same and different pairs of words significantly impact the performance of the network. In particular, we show that word frequency compression improves learning across a large range of variations in number of training pairs. This effect does not apply to the same extent to the fully unsupervised setting, where the pairs of same-different words are obtained by spoken term discovery. We apply these results to pairs of words discovered using an unsupervised algorithm and show an improvement on state-of-the-art in unsupervised representation learning using siamese networks.

研究动机与目标

  • 系统评估采样策略(尤其是词频分布与样本构成)对孪生网络在语音表示学习中性能的影响。
  • 研究齐普夫定律、说话人分布以及相同/不同样本对比例如何影响弱监督与完全无监督设置下的学习效果。
  • 将基于黄金标注数据的最优采样超参数迁移至无监督语音词项发现输出中,提升零资源语音任务的性能。
  • 识别出在低资源与零资源语音场景下最大化语音可区分性的孪生网络最优采样配置。

提出的方法

  • 作者实现了一个基于PyTorch的孪生网络(ABnet3),采用共享权重和对比损失,输入为堆叠的7帧滤波器组特征对。
  • 在将样本输入网络前,使用动态时间规整(DTW)在帧级别对相同词对进行对齐。
  • 对词类应用频率压缩函数 φ,将词频分布转换以减少高频词的主导影响。
  • 通过调整选择相同词对与不同词对的概率来调节采样比例,分别控制词类级别与说话人级别的匹配。
  • 在Buckeye语料库上评估该方法,分别使用黄金词级标注(弱监督)与语音词项发现(STD)输出(完全无监督)。
  • 性能通过ABX可区分性指标进行衡量,结果报告了同说话人与跨说话人条件下的表现。

实验结果

研究问题

  • RQ1词频压缩如何影响孪生网络中学习到的语音表示的可区分性?
  • RQ2训练时相同词对与不同词对的最佳比例是多少?该比例如何随数据量与分布变化?
  • RQ3在弱监督数据(黄金标注)上优化的采样策略,能否成功迁移到使用语音词项发现输出的完全无监督设置中?
  • RQ4语音词项发现系统中DTW阈值如何影响样本质量与下游表示学习效果?
  • RQ5基于齐普夫定律的采样超参数在零资源语音表示学习中能多大程度上提升性能?

主要发现

  • 对词类应用频率压缩(φ: n → 1)可显著提升弱监督设置下的ABX可区分性,使Buckeye数据集上的错误率降低至10.4(同说话人)与17.2(跨说话人)。
  • 最优采样配置采用 P^w_- = 0.7(70%不同词对)与 P^s_- = 0(无说话人混合),优于标准的50/50划分。
  • 该采样策略迁移至无监督设置(使用Jansen et al.的STD系统发现的词对)后,在 δ = 0.88 时达到17.7(跨说话人)的ABX错误率,优于以往的神经网络基线方法。
  • STD系统中覆盖度与NED的最佳平衡出现在 δ = 0.88,此时聚类数为9,853,NED = 0.442,覆盖度 = 0.394,同时保持了较强的可区分性。
  • 尽管性能有所提升,基于DPGMM的方法(Heck et al.)在ZeroSpeech 2015基准上仍为最先进方法,Buckeye数据集上跨说话人ABX错误率为8.0。
  • 本研究证实,采样策略是一个关键超参数,其影响程度与网络架构或损失函数选择相当。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。