Skip to main content
QUICK REVIEW

[论文解读] A Hierarchical Subspace Model for Language-Attuned Acoustic Unit Discovery

Bolaji Yusuf, Lucas Ondel|arXiv (Cornell University)|Nov 4, 2020
Speech Recognition and Synthesis参考文献 33被引用 5
一句话总结

本文提出了一种分层子空间模型,用于无监督声学单元发现,通过从转录语言中迁移语言无关的超子空间,学习语言特定的语音单元。通过在低维子空间中联合推断语言和单元嵌入,该模型在TIMIT、Mboshi和Yoruba数据集上实现了最先进性能,聚类质量(NMI)和分割准确率(F-score)均优于先前方法。

ABSTRACT

In this work, we propose a hierarchical subspace model for acoustic unit discovery. In this approach, we frame the task as one of learning embeddings on a low-dimensional phonetic subspace, and simultaneously specify the subspace itself as an embedding on a hyper-subspace. We train the hyper-subspace on a set of transcribed languages and transfer it to the target language. In the target language, we infer both the language and unit embeddings in an unsupervised manner, and in so doing, we simultaneously learn a subspace of units specific to that language and the units that dwell on it. We conduct our experiments on TIMIT and two low-resource languages: Mboshi and Yoruba. Results show that our model outperforms major acoustic unit discovery techniques, both in terms of clustering quality and segmentation accuracy.

研究动机与目标

  • 解决在无转录数据的低资源语言中进行无监督声学单元发现的挑战。
  • 通过将先验语音知识融入模型的归纳偏置,提升聚类和分割性能。
  • 通过分层结构实现语音子空间的语言特定适应,学习语言和单元嵌入。
  • 在声学单元发现任务中超越现有的非分层方法和基于神经网络的方法。

提出的方法

  • 该模型采用分层结构,其中声学单元参数被约束在低维语音子空间中,而该子空间本身由从转录语言中学习到的超子空间参数化。
  • 超子空间被建模为一组矩阵(子空间模板),目标语言的子空间通过一个学习到的嵌入向量组合这些模板形成。
  • 单元参数通过可微函数 f(·) 生成,应用于 W·e^u + b,其中 e^u 是单元嵌入,W 和 b 由转录语言固定。
  • 该模型采用贝叶斯非参数方法,对单元分配使用狄利克雷过程先验,允许发现未知数量的单元。
  • 超子空间在多个转录语言上进行训练,并迁移至目标语言,在无监督条件下联合推断语言和单元嵌入。
  • 该方法使用HMM,其状态特定参数由子空间导出,确保学习到的单元是合理的语音单元。

实验结果

研究问题

  • RQ1能否通过从转录语言向低资源目标语言迁移语音知识,利用分层子空间模型提升声学单元发现性能?
  • RQ2在共享且受限的子空间中联合学习语言和单元嵌入,是否能带来优于非分层基线的聚类和分割性能?
  • RQ3与强大的基于神经网络的方法(如VQ-wav2vec和ResDAVEnet-VQ)相比,该模型在NMI和F-score上的表现如何?
  • RQ4在目标语言上微调子空间参数是否足够,还是分层结构提供了显著优势?
  • RQ5该模型能否在无显式语言标签的情况下隐式聚类同一语言的子集,表明其学习了有效的语言嵌入?

主要发现

  • H-SHMM模型在TIMIT语料库上实现了最高的NMI(40.04 ± 0.51)和F-score(76.60 ± 0.54),优于SHMM基线和所有基于神经网络的模型。
  • 在Mboshi语料上,H-SHMM实现了NMI为41.07 ± 1.09和F-score为59.15 ± 1.51,显著优于SHMM基线(NMI为38.38 ± 0.97,F-score为59.50 ± 0.78)。
  • 在Yoruba语料上,H-SHMM实现了NMI为40.06 ± 0.11和F-score为66.95 ± 0.36,优于SHMM基线(NMI为38.99 ± 0.08,F-score为64.46 ± 0.51)。
  • 在目标语言上微调SHMM子空间(SHMM+finetune)的性能劣于SHMM和H-SHMM,表明分层结构对性能至关重要。
  • 将子空间维度增加到300(SHMM+300d)并未带来显著性能提升,表明100维的超子空间已足够,且分层设计比单纯扩展参数更有效。
  • 语言嵌入的可视化显示,同一语言的子集收敛后具有较低的类内方差,证实了模型在无显式标签情况下学习有意义语言特定表示的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。