Skip to main content
QUICK REVIEW

[论文解读] End-to-end Learning of LDA by Mirror-Descent Back Propagation over a Deep Architecture

Jianshu Chen, Ji He|arXiv (Cornell University)|Aug 14, 2015
Speech Recognition and Synthesis参考文献 22被引用 8
一句话总结

本文提出了一种针对潜在狄利克雷分配(LDA)的端到端、完全判别式训练方法,通过在深度架构上使用镜像下降反向传播,实现了主题推断与模型参数的联合优化。该方法在真实世界分类与回归任务中显著优于以往的监督主题模型,并与深度神经网络性能相当。

ABSTRACT

We develop a fully discriminative learning approach for supervised Latent Dirichlet Allocation (LDA) model using Back Propagation (i.e., BP-sLDA), which maximizes the posterior probability of the prediction variable given the input document. Different from traditional variational learning or Gibbs sampling approaches, the proposed learning method applies (i) the mirror descent algorithm for maximum a posterior inference and (ii) back propagation over a deep architecture together with stochastic gradient/mirror descent for model parameter estimation, leading to scalable and end-to-end discriminative learning of the model. As a byproduct, we also apply this technique to develop a new learning method for the traditional unsupervised LDA model (i.e., BP-LDA). Experimental results on three real-world regression and classification tasks show that the proposed methods significantly outperform the previous supervised topic models, neural networks, and is on par with deep neural networks.

研究动机与目标

  • 为克服传统变分推断或吉布斯采样方法在监督LDA中的局限性,实现完全判别式训练。
  • 将镜像下降用于精确MAP推断,并结合反向传播实现模型参数的端到端优化。
  • 开发一种可扩展、有理论依据的方法,以最大化给定文档的标签后验概率,从而提高预测准确率。
  • 将该框架扩展至无监督LDA(BP-LDA),并使用相同的反向传播机制。
  • 在真实世界回归与分类任务中,证明该方法优于现有监督主题模型,并与深度神经网络性能相当。

提出的方法

  • 该方法使用镜像下降算法(MDA)求解在特定狄利克雷参数条件下为凸优化的联合主题分布最大后验(MAP)推断问题。
  • 通过MDA-based推断模块应用反向传播,计算损失相对于模型参数的梯度,从而实现端到端训练。
  • 梯度计算涉及通过推断网络进行递归反向传播,利用伴随法将误差从输出反向传播至模型参数。
  • 对于分类任务,变换矩阵U的损失梯度推导为 $ -\frac{1}{\mathds{1}^{T}p_{L}}(I-\mathds{1}\theta_{L}^{T})\cdot U^{T}\cdot\gamma\cdot(y_{d}-\hat{y}_{d}) $,回归任务有类似表达式。
  • 通过引入变量 $ \xi_{d,\ell} = \mathds{1}^{T}p_{\ell} \cdot \delta_{\ell} $ 提升数值稳定性,替代 $ p_{\ell} $ 和 $ \delta_{\ell} $,防止溢出。
  • 该框架被应用于监督(BP-sLDA)与无监督(BP-LDA)LDA,实现主题分布与模型参数的联合优化。

实验结果

研究问题

  • RQ1能否将基于镜像下降的MAP推断与反向传播结合,实现监督LDA的端到端训练?
  • RQ2完全判别式训练——即最大化给定文档的标签后验概率——是否能提升预测性能,优于传统生成式或混合方法?
  • RQ3所提方法是否能在真实世界NLP任务中实现与深度神经网络相当的性能?
  • RQ4MDA与反向传播的结合对训练稳定性与可扩展性有何影响?
  • RQ5该框架能否扩展至无监督LDA(BP-LDA)并保持相当的性能?

主要发现

  • 所提出的BP-sLDA方法在三个真实世界回归与分类任务中显著优于以往的监督主题模型。
  • BP-sLDA性能与深度神经网络相当,证明了端到端判别式训练的有效性。
  • 通过联合优化主题推断与模型参数,该方法实现了更优的准确率,避免了传统方法中次优的两阶段训练。
  • 镜像下降与反向传播的结合实现了精确MAP推断与稳定的梯度流动,即使在深层架构中亦成立。
  • 通过 $ \xi_{d,\ell} $ 实现的数值稳定性改进,有效缓解了大 $ p_{\ell} $ 与小 $ \delta_{\ell} $ 带来的问题,提升了训练可靠性。
  • 对无监督LDA(BP-LDA)的扩展表明,该框架具有通用性,适用于判别式与生成式设置。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。