[论文解读] Semi-supervised Learning with Sparse Autoencoders in Phone Classification
该论文提出了一种单层半监督稀疏自编码器(SSSAE),通过小批量随机梯度下降,联合优化重建损失与分类损失,利用有标签和无标签数据进行训练。与监督学习相比,该方法在TIMIT数据集上的帧级音素分类准确率提升了2.9个百分点绝对值,优于大多数基于图的半监督方法,并以显著更低的计算成本接近当前最先进性能。
We propose the application of a semi-supervised learning method to improve the performance of acoustic modelling for automatic speech recognition based on deep neural net- works. As opposed to unsupervised initialisation followed by supervised fine tuning, our method takes advantage of both unlabelled and labelled data simultaneously through mini- batch stochastic gradient descent. We tested the method with varying proportions of labelled vs unlabelled observations in frame-based phoneme classification on the TIMIT database. Our experiments show that the method outperforms standard supervised training for an equal amount of labelled data and provides competitive error rates compared to state-of-the-art graph-based semi-supervised learning techniques.
研究动机与目标
- 在标注数据稀缺的低资源场景下,提升自动语音识别(ASR)中的声学建模性能。
- 解决无监督预训练方法产生的表征过于通用、未针对语音任务进行优化的问题。
- 为计算成本高昂的基于图的半监督学习(GBL)方法提供一种更高效的替代方案。
- 评估在相同有标签数据量下,单层稀疏自编码器通过联合优化是否能超越标准监督训练。
提出的方法
- 模型采用单层架构,编码器、解码器和分类器组件共享,其中编码器的输出同时用于自编码器和分类器。
- 损失函数为自编码器的重建误差(E_R)与Softmax分类器的分类误差(E_C)的加权和,定义为 E = E_R + αE_C。
- 对隐藏表征施加稀疏性,以提升特征学习效果并避免平凡解。
- 超参数α控制无监督与有监督学习之间的权衡,通过验证集调优,并随有标签数据比例增加而增大。
- 使用Theano和Titan X GPU加速,通过小批量随机梯度下降进行训练。
- 与基于图的方法不同,该方法在新增数据时无需重新训练整个图。
实验结果
研究问题
- RQ1在标注数据有限的情况下,单层稀疏自编码器能否通过联合优化重建与分类损失,提升音素分类性能?
- RQ2当使用相同数量的有标签数据时,所提出的SSSAE方法与标准监督训练相比表现如何?
- RQ3在准确率与计算效率方面,该方法是否优于现有的基于图的半监督学习技术?
- RQ4最优权衡超参数α如何随训练集中有标签数据比例的变化而变化?
- RQ5该方法在标注数据稀缺的低资源ASR场景中是否具有良好的泛化能力?
主要发现
- 当仅有1%的数据有标签时,SSSAE在测试准确率上相比标准监督训练提升了2.9个百分点绝对值,达到59.84%,而监督基线为57.93%。
- 在10%有标签数据下,SSSAE达到67.03%的测试准确率,优于所有基于图的方法,仅略低于Prior-Regularised Measure Propagation(pMP)方法的67.22%。
- 最优α值随有标签数据比例增加而增大,反映出随着有标签样本增多,分类损失优先级提升。
- 所有实验中验证集与测试集准确率始终保持接近,表明模型泛化能力强且超参数调优有效。
- 在所有有标签数据比例下,该方法均表现出一致的性能提升,尤其在低标注率下相对增益最大,这对低资源场景至关重要。
- 结果表明,通过联合优化的稀疏自编码器为ASR中复杂的基于图的半监督学习提供了一种高效且有效的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。