Skip to main content
QUICK REVIEW

[论文解读] An Algorithm for Routing Vectors in Sequences

Franz A. Heinsen|arXiv (Cornell University)|Nov 20, 2022
Machine Learning in Bioinformatics被引用 9
一句话总结

本文提出了一种高度优化的路由算法,通过最大化‘每比特收益’——即使用数据的净收益与忽略数据的成本之差——从输入序列计算输出向量。该方法使用四个可微分神经网络实现端到端的信用分配,在自然语言处理和视觉任务中实现了最先进性能,同时通过参数共享、惰性求值和张量收缩优化,将内存和计算成本降低了数个数量级。

ABSTRACT

We propose a routing algorithm that takes a sequence of vectors and computes a new sequence with specified length and vector size. Each output vector maximizes "bang per bit," the difference between a net benefit to use and net cost to ignore data, by better predicting the input vectors. We describe output vectors as geometric objects, as latent variables that assign credit, as query states in a model of associative memory, and as agents in a model of a Society of Mind. We implement the algorithm with optimizations that reduce parameter count, computation, and memory use by orders of magnitude, enabling us to route sequences of greater length than previously possible. We evaluate our implementation on natural language and visual classification tasks, obtaining competitive or state-of-the-art accuracy and end-to-end credit assignments that are interpretable.

研究动机与目标

  • 通过实现模型决策对输入组件的可解释性归因,解决深度学习中的信用分配问题。
  • 通过降低计算和内存复杂度,将路由算法扩展至长序列(最高达一百万个向量)。
  • 将几何、潜在变量、联想记忆和心智社会理论等多种理论视角统一到单一路由框架中。
  • 实现一个支持大规模 NLP 和视觉基准测试中具有竞争力性能的路由系统,且计算开销极低。
  • 提供完全可解释、可微分的路由机制,支持端到端信用分配,以促进模型分析与调试。

提出的方法

  • 该算法使用四个神经网络:$\mathcal{A}$ 用于计算输入激活分数,$\mathcal{F}$ 用于从输入生成建议的输出向量,$\mathcal{G}$ 用于从输出预测输入,$\mathcal{S}$ 用于对预测与实际输入之间的一致性进行评分。
  • 输出向量通过并行迭代方式更新,以最大化‘每比特收益’,其定义为使用数据的净收益与忽略数据的净成本之差。
  • 网络 $\mathcal{F}$ 通过缩放张量积与位置感知偏置的组合进行优化,显著减少了参数量。
  • 对 $\mathcal{F}$ 输出的惰性求值避免了中间结果的存储,将内存使用量降低了数个数量级。
  • 更新输出状态的计算被分解为高效的张量收缩操作,最大限度地减少了内存和计算开销。
  • 该方法支持输入长度、向量大小、输出向量数量和输出大小的线性扩展,从而可控制资源使用。

实验结果

研究问题

  • RQ1能否设计一种路由算法,在保持低内存和计算成本的前提下,扩展至长序列(如一百万个向量)?
  • RQ2‘每比特收益’优化是否能提升深度网络的预测性能,并实现更可解释的信用分配?
  • RQ3如何将几何、潜在变量、联想记忆和多智能体系统视角下的路由机制统一?
  • RQ4该路由机制能否在大规模 NLP 和视觉基准测试中实现最先进准确率,同时支持端到端信用分配?
  • RQ5通过参数共享、惰性求值和张量优化,计算和内存开销能在多大程度上被降低?

主要发现

  • 该算法成功实现了对长达一百万个向量的序列路由,每个向量包含 1024 个元素,展示了超越以往路由方法的可扩展性。
  • 在 IMDB 情感分类任务中,该方法实现了 96.2% 的准确率,创下新的最先进结果。
  • 在 ImageNet-1K 分类任务中,使用 BEiT-large 模型,该模型达到了 86.7% 的 top-1 准确率,表明其在视觉基准测试中表现强劲。
  • 可计算出最大达 4925 × 1000 元素的端到端信用分配矩阵,支持对子词标记和图像块的细粒度归因。
  • 观察到的最大信用分配矩阵对应于 196 个图像块的输入,且具有 25 层 Transformer 深度,展示了详细的时空与层次归因。
  • 信用分配具有可解释性:在视觉任务中,深层注意力被分配到特定身体部位(如鼻子、爪子);在 NLP 任务中,情感被关联到跨层的关键短语。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。