Skip to main content
QUICK REVIEW

[论文解读] Connecting Weighted Automata and Recurrent Neural Networks through Spectral Learning

Guillaume Rabusseau, Tianyu Li|arXiv (Cornell University)|Jul 4, 2018
Machine Learning and Algorithms参考文献 47被引用 10
一句话总结

本文建立了加权有限自动机(WFAs)与具有线性激活函数的二阶循环神经网络(2-RNNs)之间的严格表达等价性,表明线性2-RNNs可将WFAs推广至连续输入序列。本文提出了首个针对线性2-RNNs的可证明一致的学习算法,通过在Hankel张量上进行谱学习,利用低秩结构与张量列车恢复技术,从连续序列中估计模型参数。

ABSTRACT

In this paper, we unravel a fundamental connection between weighted finite automata~(WFAs) and second-order recurrent neural networks~(2-RNNs): in the case of sequences of discrete symbols, WFAs and 2-RNNs with linear activation functions are expressively equivalent. Motivated by this result, we build upon a recent extension of the spectral learning algorithm to vector-valued WFAs and propose the first provable learning algorithm for linear 2-RNNs defined over sequences of continuous input vectors. This algorithm relies on estimating low rank sub-blocks of the so-called Hankel tensor, from which the parameters of a linear 2-RNN can be provably recovered. The performances of the proposed method are assessed in a simulation study.

研究动机与目标

  • 形式化建立加权有限自动机(WFAs)与具有线性激活函数的二阶循环神经网络(2-RNNs)之间的表达等价性。
  • 将谱学习从离散符号WFAs推广至向量值WFAs与具有连续输入序列的线性2-RNNs。
  • 为线性2-RNNs开发一种一致且可证明的学习算法,能够从未见的连续向量序列中恢复模型参数。
  • 解决谱学习在WFAs中长期存在的局限性——传统上仅适用于离散输入。
  • 研究所提方法在噪声与秩参数误设条件下的鲁棒性与样本效率。

提出的方法

  • 利用线性2-RNNs与向量值WFAs之间的等价性,将学习问题建模为低秩张量恢复问题。
  • 通过矩阵感知与张量恢复技术,从连续输入向量序列中估计Hankel张量的低秩子块。
  • 利用线性2-RNNs的多线性结构,将Hankel子块重构成具有低张量列车(TT)秩的高阶张量。
  • 使用迭代硬阈值化(IHT)与截断IHT(TIHT)从含噪声的有限训练数据中恢复低秩Hankel张量。
  • 应用随机梯度下降(SGD)对初始谱估计进行微调,以提升泛化能力与性能表现。
  • 采用数值稳定化方案:若模型的训练均方误差超过零函数的误差,则返回零模型,以避免数值失败。

实验结果

研究问题

  • RQ1当输入为离散符号时,线性2-RNNs与加权有限自动机之间是否存在精确的数学等价性?
  • RQ2WFAs的谱学习算法能否扩展至处理连续输入序列,从而实现对离散字母表的超越?
  • RQ3能否利用线性2-RNN的Hankel张量中的低秩结构,设计出适用于连续输入的一致学习算法?
  • RQ4所提算法在样本效率与对噪声及秩参数误设的鲁棒性方面表现如何?
  • RQ5能否通过SGD端到端微调初始谱估计,从而实现性能提升?该方法是否在性能上超越标准RNN?

主要发现

  • 所提谱学习算法即使在噪声条件下,也能一致地从训练数据中恢复目标函数,且随着训练数据规模增大,性能持续提升。
  • IHT与TIHT方法在样本效率上优于其他恢复方法,尤其在噪声环境下表现更优,证实了利用低秩张量结构的优势。
  • TIHT优于其基于矩阵的对应方法(IHT),表明利用张量列车结构可显著提升估计精度。
  • 通过SGD对TIHT估计进行微调可一致地提升性能,且在合成任务上常达到或超过标准LSTM的性能。
  • 过度估计秩参数需要更多训练样本,但仍能收敛至目标函数;而秩参数低估则导致学习失败。
  • 该方法能成功泛化至训练过程中未见过的更长序列,表明其具备良好的归纳偏置与泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。