Skip to main content
QUICK REVIEW

[论文解读] Hyena Hierarchy: Towards Larger Convolutional Language Models

Michael Poli, Stefano Massaroli|arXiv (Cornell University)|Feb 21, 2023
Topic Modeling被引用 75
一句话总结

Hyena 提出了一种子二次复杂度、无注意力的算子,其由对隐式长卷积与门控的递归构成,在减少计算量、在长上下文上实现接近 Transformer 的语言建模质量,并且推理更快。

ABSTRACT

Recent advances in deep learning have relied heavily on the use of large Transformers due to their ability to learn at scale. However, the core building block of Transformers, the attention operator, exhibits quadratic cost in sequence length, limiting the amount of context accessible. Existing subquadratic methods based on low-rank and sparse approximations need to be combined with dense attention layers to match Transformers, indicating a gap in capability. In this work, we propose Hyena, a subquadratic drop-in replacement for attention constructed by interleaving implicitly parametrized long convolutions and data-controlled gating. In recall and reasoning tasks on sequences of thousands to hundreds of thousands of tokens, Hyena improves accuracy by more than 50 points over operators relying on state-spaces and other implicit and explicit methods, matching attention-based models. We set a new state-of-the-art for dense-attention-free architectures on language modeling in standard datasets (WikiText103 and The Pile), reaching Transformer quality with a 20% reduction in training compute required at sequence length 2K. Hyena operators are twice as fast as highly optimized attention at sequence length 8K, and 100x faster at sequence length 64K.

研究动机与目标

  • 激发在大规模下能够匹配注意力的子二次复杂度算子搜索。
  • 将 Hyena 介绍为一个数据控制的、基于长卷积并带门控的算子。
  • 表明 Hyena 如何缩小在语言建模及需要长上下文的任务上与注意力的性能差距。
  • 展示 Hyena 在长序列和视觉任务上的效率优势。
  • 在基准测试和数据集上评估 Hyena 的可扩展性与通用性。

提出的方法

  • 将 Hyena 定义为由长卷积的递归交错着乘法门控形成的数据控制算子。
  • 通过可学习的滤波器(使用神经隐式表示实现的窗口,基于 FFN)对长卷积进行隐式参数化。
  • 使用基于 FFT 的快速卷积在不显式构造完整算子的情况下评估 Hyena,以实现 O(L log L) 计算。
  • 通过使用因果卷积和填充策略,确保自回归设置的因果性。
  • 将 Hyena 与最前沿的子二次方法在联想召回、语言建模和视觉任务上进行比较。
  • 将运行时与注意力机制和 FlashAttention 进行基准测试,以量化在非常长的序列上的加速效果。

实验结果

研究问题

  • RQ1在大规模下,子二次、无注意力的算子能否达到与密集注意力相当的质量?
  • RQ2数据控制的长卷积为基础的架构在长上下文推理任务上在多大程度上缩小了性能差距?
  • RQ3对长卷积的不同隐式参数化如何影响可扩展性、内存和准确性?
  • RQ4与基于注意力的方法相比,Hyena 在长序列上的效率和加速收益有哪些?
  • RQ5Hyena 是否在语言任务之外也有效,例如在大规模图像分类中?

主要发现

  • Hyena 在 The Pile 上实现与基于 Transformer 模型相近的困惑度和下游表现,在序列长度为 2K 时总 FLOPs 减少 20%。
  • Hyena 在序列长度从 8K 到 64K 的范围内,可实现对密集注意力 5x 到 100x 的加速。
  • 在 The Pile 上,335M 参数的 Hyena 与 Transformer 的困惑度相当,FLOP 降低 20%。
  • 在 WikiText103 和 The Pile 上,Hyena 以子二次计算达到接近 Transformer 的质量,且不混合注意力。
  • 在图像分类中,替换注意力层后,Hyena 与基于注意力的 ViT 在 ImageNet-1k 的性能相当。
  • 在长联想召回任务中,隐式参数化优于其他长卷积方法,对于更长的序列和更大的词汇表,效果提升更大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。