[论文解读] Towards Unsupervised Automatic Speech Recognition Trained by Unaligned Speech and Text only
本文提出了一种三阶段无监督自动语音识别(ASR)框架,通过自监督预训练和跨模态嵌入对齐,从未对齐的语音和文本中学习词级语音表征。通过使用带有对抗训练的序列到序列自编码器解耦语音和说话人信息,利用跳跃语法模型学习语义嵌入,并通过MBC-ICP将它们对齐到文本嵌入空间,该方法在词检索任务中实现了60.68%的top-10最近邻准确率,证明了在无任何对齐信息的情况下实现无监督ASR的可行性。
Automatic speech recognition (ASR) has been widely researched with supervised approaches, while many low-resourced languages lack audio-text aligned data, and supervised methods cannot be applied on them. In this work, we propose a framework to achieve unsupervised ASR on a read English speech dataset, where audio and text are unaligned. In the first stage, each word-level audio segment in the utterances is represented by a vector representation extracted by a sequence-of-sequence autoencoder, in which phonetic information and speaker information are disentangled. Secondly, semantic embeddings of audio segments are trained from the vector representations using a skip-gram model. Last but not the least, an unsupervised method is utilized to transform semantic embeddings of audio segments to text embedding space, and finally the transformed embeddings are mapped to words. With the above framework, we are towards unsupervised ASR trained by unaligned text and speech only.
研究动机与目标
- 在缺乏语音-文本对齐的低资源环境下,实现无监督自动语音识别。
- 使用自监督方法从未对齐的语音和文本中学习有意义的语义和语音表征。
- 通过学习音频与文本嵌入之间的线性变换,无监督地弥合两者之间的语义鸿沟。
- 验证仅使用未对齐语音和文本数据实现端到端无监督ASR的可行性。
提出的方法
- 使用带有对抗训练的序列到序列自编码器对词级语音片段中的语音和说话人信息进行解耦,生成语音表征。
- 通过跳跃语法模型从解耦的语音向量中学习语义嵌入,类似于Word2Vec但应用于音频表征。
- 采用无监督对齐方法——小批量循环迭代最近点(MBC-ICP),通过主成分分析(PCA)和仿射变换将音频语义嵌入映射到文本语义嵌入空间。
- 该方法分为三个阶段:(1) 通过解耦进行语音表征提取,(2) 语义嵌入学习,(3) 跨模态嵌入对齐。
- 框架使用前100个主成分进行降维,并在最后对齐步骤中使用带有学习率衰减的随机梯度下降进行训练。
- 通过基准词相似度数据集上的Spearman等级相关系数以及词检索任务的top-k最近邻准确率对模型进行评估。
实验结果
研究问题
- RQ1能否通过自监督音频和文本建模,从未对齐的语音和文本中有效学习语义表征?
- RQ2解耦语音和说话人信息是否能提升下游ASR任务中所学音频表征的质量?
- RQ3在无任何配对样本的情况下,是否能通过线性变换将音频语义表征对齐到文本语义表征?
- RQ4无监督或弱监督对齐在多大程度上能恢复未对齐语音和文本中的词级对应关系?
主要发现
- SE/SAD方法——从解耦语音表征中训练的语义嵌入——在使用5000对标注样本的情况下,实现了60.68%的最高top-10最近邻准确率。
- 解耦显著提升了语义相关性得分,Spearman等级相关系数在OHW和PEW两个基准上均有所提高。
- 使用5000对标注样本进行弱监督微调后,top-10准确率提升至86.38%,表明少量监督可极大增强对齐性能。
- MBC-ICP方法成功学习了音频与文本语义嵌入之间的仿射变换,验证了即使无配对数据也存在线性映射关系。
- 音频语义嵌入在语义相似度任务中优于原始自编码器嵌入,证实了跳跃语法预训练阶段的有效性。
- 结果表明,尽管完全无监督对齐仍具挑战性,但该框架为实现最小监督下的无监督ASR提供了可行路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。