Skip to main content
QUICK REVIEW

[论文解读] Learning Online Alignments with Continuous Rewards Policy Gradient

Yuping Luo, Chung‐Cheng Chiu|arXiv (Cornell University)|Aug 3, 2016
Topic Modeling参考文献 17被引用 10
一句话总结

本文提出一种基于连续奖励与策略梯度训练的序列到序列模型,通过硬性在线对齐实现端到端实时语音识别,无需预先获取完整输入序列。通过采用随机二值决策来触发输出生成,该模型在TIMIT和WSJ数据集上均表现出色,证明了其在在线语音翻译系统中的可行性。

ABSTRACT

Sequence-to-sequence models with soft attention had significant success in machine translation, speech recognition, and question answering. Though capable and easy to use, they require that the entirety of the input sequence is available at the beginning of inference, an assumption that is not valid for instantaneous translation and speech recognition. To address this problem, we present a new method for solving sequence-to-sequence problems using hard online alignments instead of soft offline alignments. The online alignments model is able to start producing outputs without the need to first process the entire input sequence. A highly accurate online sequence-to-sequence model is useful because it can be used to build an accurate voice-based instantaneous translator. Our model uses hard binary stochastic decisions to select the timesteps at which outputs will be produced. The model is trained to produce these stochastic decisions using a standard policy gradient method. In our experiments, we show that this model achieves encouraging performance on TIMIT and Wall Street Journal (WSJ) speech recognition datasets.

研究动机与目标

  • 解决序列到序列模型需等待完整输入才能生成输出的局限性,该局限性阻碍了语音翻译等实时应用的实现。
  • 通过允许模型在输入到达时逐步生成输出,实现在线推理,而无需等待整个序列输入完成。
  • 开发一种结合监督学习与策略梯度优化的方法,用于训练何时发出输出标记的随机决策。
  • 在大规模语音识别任务上验证该方法的有效性,为实现实时端到端语音翻译系统铺平道路。

提出的方法

  • 在每个时间步使用带有随机二值单元的循环神经网络,以决定是否发出输出标记。
  • 将输出生成决策建模为伯努利分布的随机变量,通过REINFORCE策略梯度估计器实现可微分。
  • 使用策略梯度方法进行策略网络训练,以最大化正确输出序列的对数似然,奖励基于生成准确度。
  • 将先前输出和决策的反馈整合到RNN隐藏状态中,以保持序列依赖性并维持模型连贯性。
  • 训练过程中应用梯度裁剪与熵正则化,以稳定学习过程并防止过早收敛。
  • 在较大规模的WSJ数据集上,使用堆叠LSTM(每层300个单元)和异步SGD(50个副本)进行训练。

实验结果

研究问题

  • RQ1在无需完整输入序列的前提下,采用硬性在线对齐的序列到序列模型能否在语音识别任务上实现具有竞争力的性能?
  • RQ2在在线设置中,基于策略梯度与随机二值决策的方法在学习何时发出输出标记方面效果如何?
  • RQ3在不可微、随机决策框架中,使用连续奖励与策略梯度训练是否能实现稳定且准确的学习?
  • RQ4该方法能否在更大、更复杂的语音识别数据集(如WSJ)上扩展,同时保持性能?
  • RQ5输出生成决策与输入语音输入的时间对齐关系如何?模型是否学会仅在有新相关信息到达时才发出输出?

主要发现

  • 该模型在TIMIT数据集上表现令人鼓舞,证明了其在支持在线推理的实时语音识别中的可行性。
  • 在更大的WSJ数据集上,尽管使用了相对较小的网络结构(2层堆叠LSTM,每层300个单元),模型仍达到了合理的准确率,显示出良好的可扩展潜力。
  • 模型学会在新音频输入到达时主要发出输出标记,表明输入处理与输出生成之间实现了有效对齐。
  • 软决策(输出概率)与硬决策(实际输出)显示,模型通常会延迟最终输出直到话语结束,可能是为了避免过早或错误预测。
  • 在某些情况下,模型成功完整转录了整个话语,包括一个示例中除一个词替换(AND → END)外,其余全部正确预测。
  • 当早期应用Dropout时会干扰训练过程,因此将其推迟到训练后期,表明策略梯度训练对正则化时机较为敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。