Skip to main content
QUICK REVIEW

[论文解读] Topic Identification for Speech without ASR

Chunxi Liu, Jan Trmal|arXiv (Cornell University)|Mar 22, 2017
Speech Recognition and Synthesis参考文献 23被引用 3
一句话总结

本文提出了一种使用无监督术语发现(UTD)和无监督音素单元发现(AUD)的无监督语音分词方法,以在无需自动语音识别(ASR)的情况下实现在低资源环境下的主题识别。结果表明,基于CNN的模型使用AUD生成的类音素单位可实现具有竞争力的性能——尤其在数据充足时——其表现优于SVM,并接近ASR基线,同时消除了对转录语音或语言特定模型的依赖。

ABSTRACT

Modern topic identification (topic ID) systems for speech use automatic speech recognition (ASR) to produce speech transcripts, and perform supervised classification on such ASR outputs. However, under resource-limited conditions, the manually transcribed speech required to develop standard ASR systems can be severely limited or unavailable. In this paper, we investigate alternative unsupervised solutions to obtaining tokenizations of speech in terms of a vocabulary of automatically discovered word-like or phoneme-like units, without depending on the supervised training of ASR systems. Moreover, using automatic phoneme-like tokenizations, we demonstrate that a convolutional neural network based framework for learning spoken document representations provides competitive performance compared to a standard bag-of-words representation, as evidenced by comprehensive topic ID evaluations on both single-label and multi-label classification tasks.

研究动机与目标

  • 解决在缺乏转录数据用于训练ASR的低资源语音设置下的主题识别问题。
  • 探究无监督语音分词方法(如UTD和AUD)是否可在无需人工转录的情况下替代ASR实现主题识别。
  • 评估基于CNN的表示学习在无监督声学单元上的有效性,相较于传统词袋特征。
  • 确定word2vec预训练和模型架构对低数据环境下性能的影响。
  • 在单标签和多标签主题分类任务中,比较UTD、AUD和ASR基线系统的性能。

提出的方法

  • 使用Zero Resource Toolkit应用无监督术语发现(UTD),通过稀疏声学相似性矩阵和基于快速DTW的匹配识别重复的类词单位。
  • 在AUD框架中使用变分贝叶斯推断,从未转录语音中学习类音素单位,实现语言无关的声学单元发现。
  • 从预训练模型中提取多语言瓶颈特征,为UTD和AUD提供语言无关的声学表征。
  • 在AUD生成的序列标记上训练卷积神经网络(CNN),以学习连续的、上下文感知的语音文档表征。
  • 对声学单元嵌入进行word2vec预训练,以提升泛化能力,尤其在低数据场景下。
  • 在学习到的表征上使用SVM和CNN分类器进行单标签和多标签主题分类,评估指标为平均精度(AP)。

实验结果

研究问题

  • RQ1无监督声学单元发现(AUD)和无监督术语发现(UTD)是否能在无转录数据的情况下生成有效的语音分词,以实现主题识别?
  • RQ2基于CNN的表示学习框架在AUD生成的类音素单位上的表现,相较于传统词袋特征如何?
  • RQ3对声学单元进行word2vec预训练是否能提升低资源环境下的主题识别性能?
  • RQ4模型性能如何随训练数据量变化,特别是CNN与SVM的对比?
  • RQ5在多种低资源语言中,UTD、AUD和ASR基线系统在主题识别准确率上的表现如何比较?

主要发现

  • 在LORELEI土耳其语数据集(16.5小时领域内数据)上,基于AUD的CNN在整体上达到0.641的平均精度(AP),在领域内主题上达到0.564,优于UTD和SVM基线。
  • 在较小语料如乌兹别克语(2.9小时领域内)和普通话(7.7小时领域内)上,基于UTD的SVM表现优于基于AUD的SVM,表明UTD在低数据环境下更具优势。
  • 在土耳其语和乌兹别克语上,基于AUD的CNN优于基于AUD的SVM,但在普通话上表现较差,表明CNN需要更多数据才能有效泛化。
  • ASR基线系统仍为最强模型,在土耳其语上整体AP为0.625,在普通话上为0.461,但需要转录数据。
  • 将AUD中的浓度参数γ从1.0增加到10.0,使唯一单元数量从184增加到199,并普遍提升了性能。
  • 与Switchboard相比,CNN与SVM模型之间的性能差距在LORELEI上更小,表明较小的LORELEI数据集(15–60小时)限制了CNN在更大语料中所获得的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。