Skip to main content
QUICK REVIEW

[论文解读] DeepSITH: Efficient Learning via Decomposition of What and When Across Time Scales

Brandon G. Jacques, Zoran Tiganj|OpenBU (Boston University)|Apr 9, 2021
Neural Networks and Applications参考文献 23被引用 5
一句话总结

DeepSITH 提出了一种深度循环网络,通过生物启发的尺度不变时间历史(SITH)模块,将时间记忆分解为'内容'(what)和'时间'(when)两部分。SITH 模块通过几何间隔分布的滤波器,在对数尺度上表示时间,实现时间历史的压缩。该方法在时间序列任务中实现了最先进性能,包括 Mackey-Glass 和 sMNIST 中的长程依赖建模,在不同延迟下训练稳定,且对噪声具有鲁棒性。

ABSTRACT

Extracting temporal relationships over a range of scales is a hallmark of human perception and cognition -- and thus it is a critical feature of machine learning applied to real-world problems. Neural networks are either plagued by the exploding/vanishing gradient problem in recurrent neural networks (RNNs) or must adjust their parameters to learn the relevant time scales (e.g., in LSTMs). This paper introduces DeepSITH, a network comprising biologically-inspired Scale-Invariant Temporal History (SITH) modules in series with dense connections between layers. SITH modules respond to their inputs with a geometrically-spaced set of time constants, enabling the DeepSITH network to learn problems along a continuum of time-scales. We compare DeepSITH to LSTMs and other recent RNNs on several time series prediction and decoding tasks. DeepSITH achieves state-of-the-art performance on these problems.

研究动机与目标

  • 为解决循环神经网络在学习长程时间依赖时因梯度消失/爆炸而面临的挑战。
  • 开发一种生物合理、尺度不变的记忆机制,以捕捉跨多个时间尺度的时间关系。
  • 通过在深层网络中分解'内容'(内容)与'时间'(时间)信息,提升序列建模的泛化能力与效率。
  • 在需要记忆广泛时间延迟的任务中实现鲁棒性能,包括噪声或时间缩放的输入。

提出的方法

  • 每个 DeepSITH 层使用一个尺度不变时间历史(SITH)模块,通过基于伽马函数的滤波器 Φₖ(t/τ̂) 计算过去输入的时间压缩表示,其峰值出现在时间延迟 τ̂ 处。
  • SITH 滤波器在时间延迟上呈几何间隔分布,实现时间历史的对数压缩,模拟大脑中观察到的神经时间细胞。
  • 密集可学习层连接连续的 SITH 层,将各层的'内容'表示进行转换,构建分层的时间特征。
  • 网络采用连续时间公式,SITH 状态通过与预计算滤波器的卷积运算得到,确保可微性与训练稳定性。
  • 时间细胞表示具有尺度不变性:滤波器宽度随时间延迟线性增加,使较早事件逐渐模糊化。
  • 该架构设计为 RNN 的即插即用替代品,仅需极少超参数调整,且与标准训练流程兼容。

实验结果

研究问题

  • RQ1一种生物启发的、尺度不变的时间表示是否能提升深度 RNN 在长程依赖学习中的表现?
  • RQ2在深层网络中分解'内容'与'时间'信息是否能增强在长延迟任务中的泛化能力与性能?
  • RQ3在不同时间延迟下,DeepSITH 与 LSTMs、LMUs 和 coRNNs 在准确率与训练稳定性方面相比如何?
  • RQ4SITH 模块中的时间对数压缩是否能实现输入序列时间缩放的不变性?
  • RQ5SITH 模块随时间逐步丧失时间精度,这种特性在真实任务中是支持还是阻碍学习?

主要发现

  • DeepSITH 在 Mackey-Glass 时间序列预测任务中达到最先进性能,优于 LSTMs 和其他最先进 RNN 模型。
  • 在加法问题中,DeepSITH 在所有测试输入延迟下均保持一致的训练速度与准确率,而 LSTMs 在延迟增加时性能显著下降。
  • 在 Hateful-8 任务中,无论噪声水平如何,DeepSITH 均达到 100% 准确率,与 LMU 网络性能相当。
  • 由于对数时间表示,该网络对缩放输入具有良好的泛化能力,系统在时间重标度下具有平移协变性。
  • SITH 模块使网络在广泛的时间尺度范围内实现稳定学习,即使延迟显著增加,性能依然稳健。
  • 通过深层网络分解'内容'与'时间'信息,使浅层能够捕捉精细的时间模式,而深层则抽象出更广泛的时间尺度特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。