Skip to main content
QUICK REVIEW

[论文解读] Stable and expressive recurrent vision models

Drew Linsley, Alekh Karkada Ashok|arXiv (Cornell University)|May 22, 2020
Cell Image Analysis Techniques参考文献 60被引用 7
一句话总结

本文提出了一种新型学习算法——Contractor 反向传播(C-RBP),使循环卷积神经网络(CNN)在训练过程中实现恒定的内存复杂度,克服了标准时间反向传播(BPTT)的 O(N) 内存瓶颈。C-RBP 结合了利普希茨常数惩罚(LCP),以确保稳定且具有表现力的动力学行为,同时结合循环反向传播,使模型能够学习长距离的空间依赖关系,并在 MS-COCO 实例分割任务中,以比最先进前馈网络少 800,000 个参数的条件下实现更优性能。

ABSTRACT

Primate vision depends on recurrent processing for reliable perception. A growing body of literature also suggests that recurrent connections improve the learning efficiency and generalization of vision models on classic computer vision challenges. Why then, are current large-scale challenges dominated by feedforward networks? We posit that the effectiveness of recurrent vision models is bottlenecked by the standard algorithm used for training them, "back-propagation through time" (BPTT), which has O(N) memory-complexity for training an N step model. Thus, recurrent vision model design is bounded by memory constraints, forcing a choice between rivaling the enormous capacity of leading feedforward models or trying to compensate for this deficit through granular and complex dynamics. Here, we develop a new learning algorithm, "contractor recurrent back-propagation" (C-RBP), which alleviates these issues by achieving constant O(1) memory-complexity with steps of recurrent processing. We demonstrate that recurrent vision models trained with C-RBP can detect long-range spatial dependencies in a synthetic contour tracing task that BPTT-trained models cannot. We further show that recurrent vision models trained with C-RBP to solve the large-scale Panoptic Segmentation MS-COCO challenge outperform the leading feedforward approach, with fewer free parameters. C-RBP is a general-purpose learning algorithm for any application that can benefit from expansive recurrent dynamics. Code and data are available at https://github.com/c-rbp.

研究动机与目标

  • 解决训练循环 CNN 时的内存瓶颈问题,该问题限制了其容量,使其难以在大规模视觉任务中与大型前馈模型竞争。
  • 解决循环视觉模型中模型稳定性与表达能力之间的根本性权衡,其中稳定动力学往往降低性能。
  • 开发一种通用学习算法,使模型能够实现扩展的循环动力学,同时保持恒定的内存复杂度,适用于大规模视觉挑战。
  • 证明 C-RBP 训练的循环模型能够学习类人视觉行为,如轮廓追踪和类似洪水填充的分割,而无需显式监督。
  • 表明 C-RBP 可在 MS-COCO 实例分割任务中实现最先进性能,且参数量远少于领先的前馈模型。

提出的方法

  • 引入利普希茨常数惩罚(LCP),一种可微正则化项,通过约束循环更新函数的雅可比矩阵,确保稳定且收缩的动力学行为。
  • 将 LCP 与循环反向传播(RBP)结合,RBP 是一种内存高效的训练方法,通过反向传播固定点迭代避免存储隐藏状态。
  • 开发 C-RBP(Contractor-RBP),一种训练算法,无论循环步数多少,均保持 O(1) 的内存复杂度,从而支持长时序处理。
  • 将 C-RBP 应用于在合成轮廓追踪和 MS-COCO 实例分割任务上训练循环视觉模型,采用残差 U-Net 和 FPN 风格架构。
  • 使用梯度检查点和权重共享,进一步优化训练流程中的内存与参数效率。
  • 以端到端方式通过时间反向传播(BPTT)进行训练作为基线,并在内存约束下比较性能与泛化能力。

实验结果

研究问题

  • RQ1一种内存高效的训练算法是否能帮助循环 CNN 学习 BPTT 训练模型因内存限制而无法解决的长距离空间依赖关系?
  • RQ2将稳定性正则化(LCP)与 RBP 结合,是否能产生一种既保持模型表达能力又实现恒定内存复杂度的训练方法?
  • RQ3C-RBP 训练的循环模型是否在分布外数据上的泛化能力优于前馈模型?
  • RQ4C-RBP 训练的循环模型是否能在 MS-COCO 实例分割等大规模视觉基准上实现最先进性能,且参数量远少于其他方法?
  • RQ5C-RBP 训练的模型是否能学习类人视觉行为,如轮廓追踪或类似洪水填充的分割,而无需显式监督?

主要发现

  • C-RBP 训练的循环模型在合成轮廓追踪任务中成功检测到长距离空间依赖关系,而 BPTT 训练的模型因内存限制而失败。
  • 在 MS-COCO 实例分割挑战中,C-RBP 训练的循环模型在性能上优于领先的前馈方法,且参数量减少了近 800,000 个。
  • C-RBP 模型在分布外测试样本上的泛化能力优于 BPTT 训练的模型,表明其鲁棒性更强。
  • C-RBP 允许在标准 NVIDIA Titan X GPU 的内存容量下训练循环视觉模型,即使对于长循环序列也适用。
  • C-RBP 模型中学习到的动力学行为类似于类人视觉行为,如洪水填充算法,尽管没有为该行为提供显式监督。
  • 利普希茨常数惩罚(LCP)成功解决了稳定性与表达能力之间的权衡,使模型在保持高性能的同时确保训练稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。