QUICK REVIEW
[论文解读] Weakly Supervised Multi-Embeddings Learning of Acoustic Models
Gabriel Synnaeve, Emmanuel Dupoux|arXiv (Cornell University)|Dec 20, 2014
Speech Recognition and Synthesis参考文献 11被引用 6
一句话总结
本文提出一种弱监督的孪生神经网络,通过仅使用相同/不同词和说话人标签,联合学习音素和说话人嵌入。通过在Buckeye语料库的一个子集上使用多任务损失进行训练,该模型在音素和说话人区分任务中均表现出色,表明在极小监督下可有效学习共享表征,并揭示说话人身份在嵌入空间中比音素身份编码得更稀疏、更具体。
ABSTRACT
We trained a Siamese network with multi-task same/different information on a speech dataset, and found that it was possible to share a network for both tasks without a loss in performance. The first task was to discriminate between two same or different words, and the second was to discriminate between two same or different talkers.
研究动机与目标
- 探究仅使用弱监督(相同/不同标签)是否可行实现音素与说话人嵌入的联合学习。
- 评估共享孪生网络架构是否能在不降低性能的前提下,同时保持音素和说话人区分任务的性能。
- 分析隐藏层与嵌入层中信息编码的特性,特别是音素与说话人身份编码的专门化程度。
- 评估此类嵌入是否可作为i-vectors在下游语音识别任务中的可行替代或补充。
提出的方法
- 采用孪生网络架构,两个并行分支处理11帧的对数梅尔滤波器组特征。
- 网络包含三个各含500个神经元的隐藏层,激活函数为Sigmoid,每个输入生成两个100维嵌入:一个用于词身份(音素),一个用于说话人身份。
- 使用多任务损失函数,结合基于余弦相似度的损失项,分别处理词和说话人相同/不同分类任务,损失函数由两项之和构成。
- 损失函数采用基于边距的方法:对于相同样本对,最小化 1 - cos(相似度);对于不同样本对,最大化 cos²(相似度)。
- 使用Adadelta优化算法,自适应学习率,并在10%的保留开发集上采用早停策略。
- 通过F检验分析各层单元的类间与类内方差比,将单元分类为音素特异性、说话人特异性或双重特异性。
实验结果
研究问题
- RQ1单个孪生网络能否仅使用相同/不同词和说话人标签,有效学习音素与说话人嵌入?
- RQ2联合训练对各独立任务性能的影响如何,相较于单任务训练?
- RQ3隐藏层与嵌入层中,音素与说话人身份编码的专门化程度如何?
- RQ4编码单元的稀疏性与分布如何随网络层演化?
- RQ5所学习的嵌入是否能支持下游任务,如音素区分或说话人验证?
主要发现
- 多任务模型在音素和说话人区分任务中均表现优异,性能未低于单任务基线模型。
- 多任务设置下的说话人区分性能优于滤波器组基线,表明语音特征有助于说话人识别。
- 音素嵌入层性能较低(ABX准确率为64.8%),低于说话人嵌入层(ABX准确率为85.1%),表明当前设置下音素编码不够鲁棒。
- 隐藏层分析显示,早期层主要编码音素信息,而后期层逐渐增强说话人特异性编码,双重编码单元数量减少。
- 说话人嵌入层表现出高度稀疏且特异的编码方式,而音素嵌入层包含更多双重使用且特异性较低的单元,表明受说话人差异影响较大。
- 滤波器组系数分析显示,低频带对语音内容更敏感,而高频带对说话人特征更敏感。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。