Skip to main content
QUICK REVIEW

[论文解读] Semi-Supervised Phone Classification using Deep Neural Networks and Stochastic Graph-Based Entropic Regularization

Sunil Thulasidasan, Jeffrey A. Bilmes|arXiv (Cornell University)|Dec 15, 2016
Speech Recognition and Synthesis参考文献 19被引用 5
一句话总结

本文提出了一种基于图的随机性熵正则化方法,用于使用深度神经网络进行半监督语音分类。通过构建元小批量样本,其基于图划分的迷你小批量样本具有受控的多样性与邻居连通性,该方法实现了高效、可扩展的训练,在低标注数据设置下显著提升了准确率,同时在完全标注设置下仍保持竞争力。

ABSTRACT

We describe a graph-based semi-supervised learning framework in the context of deep neural networks that uses a graph-based entropic regularizer to favor smooth solutions over a graph induced by the data. The main contribution of this work is a computationally efficient, stochastic graph-regularization technique that uses mini-batches that are consistent with the graph structure, but also provides enough stochasticity (in terms of mini-batch data diversity) for convergence of stochastic gradient descent methods to good solutions. For this work, we focus on results of frame-level phone classification accuracy on the TIMIT speech corpus but our method is general and scalable to much larger data sets. Results indicate that our method significantly improves classification accuracy compared to the fully-supervised case when the fraction of labeled data is low, and it is competitive with other methods in the fully labeled case.

研究动机与目标

  • 开发一种计算高效的随机图正则化技术,用于深度神经网络中的半监督学习。
  • 在通过图感知的小批量样本构建实现随机梯度下降收敛的同时,保持数据的分布特性。
  • 在低标注数据场景下,提升TIMIT语料库中帧级语音分类的准确率。
  • 将该方法推广至更大规模数据集及其他分类任务。
  • 在元小批量样本中平衡随机性与邻居连通性,以实现最优正则化性能。

提出的方法

  • 该方法使用参数化目标函数,结合监督交叉熵损失、基于图的熵正则化以及熵和L2正则化。
  • 通过递归图划分(如METIS)构建元小批量样本,以确保子组平衡且连通,同时保持数据多样性。
  • 在小批量外的邻居上应用随机正则化,从而在保证足够多样性以实现收敛的前提下支持梯度更新。
  • 基于数据相似性(如余弦或RBF核)构建图,并用于在连接节点间强制模型预测的平滑性。
  • 该框架支持使用ReLU激活函数和Dropout的MLP与深度神经网络,并采用自适应优化策略以支持长时间训练。
  • 元小批量样本的构建方式允许在小批量多样性(熵)与邻居连通性之间进行权衡,以提升正则化效果。

实验结果

研究问题

  • RQ1随机图正则化能否在低标注数据设置下提升半监督语音分类的准确率?
  • RQ2元小批量样本的多样性与邻居连通性之间的权衡如何影响模型性能?
  • RQ3能否通过小批量训练高效地将基于图的正则化应用于深度神经网络?
  • RQ4与先前的基于图的SSL方法相比,所提方法在准确率和可扩展性方面表现如何?
  • RQ5在低标注设置下,使用均匀分布作为熵先验是否优于或可与首次分类器生成的先验分布相媲美?

主要发现

  • 所提出的随机图正则化方法在TIMIT语料库的低标注场景下,显著提升了帧级语音分类的准确率。
  • 对于MLP,该方法在低标签比例下优于基础监督模型和先前的图正则化方法。
  • 在DNN设置下,尽管使用了均匀先验,该方法在低标签比例下仍优于先前工作[3],并优于非参数方法[4],表现出更高的准确率。
  • 测试误差曲线显示,元小批量样本的多样性与邻居连通性之间存在最优权衡,当连通性过低时性能下降。
  • 在完全标注情况下,该方法保持了具有竞争力的性能,展示了其可扩展性与鲁棒性。
  • 通过图划分和小批量外正则化的元小批量设计,实现了高效、收敛的训练,为深度网络提供了足够的随机性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。