Skip to main content
QUICK REVIEW

[论文解读] Evolino for recurrent support vector machines

Jürgen Schmidhuber, Matteo Gagliolo|ArXiv.org|Dec 15, 2005
Neural Networks and Reservoir Computing参考文献 32被引用 22
一句话总结

该论文提出Evoke,一种新颖的进化算法,将循环神经网络(RNN)与支持向量机(SVM)相结合,构建真正序列化、核自适应的模型,能够学习长期时间依赖关系。通过进化基于LSTM的RNN来预处理输入,并利用二次规划优化SVM实现最优输出预测,Evoke在处理上下文敏感语言和多重叠加正弦波的任务中,优于基于梯度的RNN(如G-LSTM)和ESNs。

ABSTRACT

Traditional Support Vector Machines (SVMs) need pre-wired finite time windows to predict and classify time series. They do not have an internal state necessary to deal with sequences involving arbitrary long-term dependencies. Here we introduce a new class of recurrent, truly sequential SVM-like devices with internal adaptive states, trained by a novel method called EVOlution of systems with KErnel-based outputs (Evoke), an instance of the recent Evolino class of methods. Evoke evolves recurrent neural networks to detect and represent temporal dependencies while using quadratic programming/support vector regression to produce precise outputs. Evoke is the first SVM-based mechanism learning to classify a context-sensitive language. It also outperforms recent state-of-the-art gradient-based recurrent neural networks (RNNs) on various time series prediction tasks.

研究动机与目标

  • 解决传统SVM在处理具有任意长期依赖关系的序列时的根本局限性。
  • 开发一种类似SVM的循环模型,能够学习内部状态表示以应对上下文敏感的序列任务。
  • 提升在复杂时间序列预测任务中的泛化能力和性能,这些任务中基于梯度的RNN和ESNs表现不佳或失败。
  • 探索利用进化计算训练混合模型(结合神经进化与分析式SVM优化)的可行性。
  • 证明基于核的输出层可使SVM解决标准SVM无法处理的问题,例如$a^n b^n c^n$语言识别任务。

提出的方法

  • Evoke采用两阶段架构:进化型循环神经网络(具体为LSTM)处理序列输入并生成隐藏表示。
  • RNN生成的隐藏状态被输入至支持向量机(SVM),该SVM通过最大间隔准则使用二次规划计算最优输出权重。
  • RNN通过ESP(带种群的进化策略)算法进行进化,适应度由SVM输出的训练误差与验证误差之和决定。
  • SVM组件使用高斯核,其超参数固定(标准差为2.0,容量为100.0或10.0,视任务而定),以将输入序列映射到高维空间,实现非线性决策边界。
  • 进化过程持续50代,采用柯西分布的突变和爆发突变,适应度函数结合训练误差与验证误差,以防止过拟合。
  • 该方法是更广泛框架Evolino的一个特例,Evolino结合了神经进化与分析式线性输出模型,此处被适配为SVM而非伪逆回归。

实验结果

研究问题

  • RQ1基于RNN的SVM类模型能否学习到捕捉序列数据中任意长期依赖关系的内部表示?
  • RQ2将进化型RNN与SVM结合是否能在涉及上下文敏感语法的任务中优于基于梯度的RNN(如G-LSTM)?
  • RQ3Evoke能否成功学习并泛化于具有多重叠加正弦波的时间序列任务?该任务中ESNs会失败。
  • RQ4在序列学习中,使用基于SVM的输出层与二次规划优化,是否比基于伪逆的方法具有更好的泛化能力?
  • RQ5与更简单的回归基模型相比,核自适应模型的适应度景观如何影响进化搜索效率?

主要发现

  • Evoke成功实现了对上下文敏感语言$a^n b^n c^n$($n=10$ 和 $n=20$)的分类,并在训练集之外实现泛化,而标准SVM无法完成此任务。
  • 在$a^n b^n c^n$任务中,Evoke的泛化能力优于G-LSTM,但随着$n$增大性能下降,此时PI-Evolino和G-LSTM表现更优。
  • 在双叠加正弦波任务($\sin(0.2x) + \sin(0.311x)$)中,Evoke在300个测试点上平均测试误差为0.021,优于ESNs,并且收敛速度超过G-LSTM。
  • 尽管取得成功,Evoke的性能仍逊于基于伪逆的Evolino(PI-Evolino),后者在相同正弦波任务上实现0.003的测试误差,表明核映射导致适应度景观更崎岖。
  • Evoke在长事件间时间延迟的任务中泛化良好,例如$a^n b^n c^n$语法,证明其具备学习复杂时间依赖关系的能力。
  • 该方法在3 GHz台式机上平均每次模拟耗时约6分钟,表明其在混合模型进化训练中具有合理的计算效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。