Skip to main content
QUICK REVIEW

[论文解读] General-purpose, long-context autoregressive modeling with Perceiver AR

Curtis Hawthorne, Andrew Jaegle|arXiv (Cornell University)|Feb 15, 2022
Generative Adversarial Networks and Image Synthesis被引用 34
一句话总结

Perceiver AR 引入了一种自回归、模态无关的架构,使用跨注意力将非常长的输入压缩到一个较小的潜在集合,并在潜在空间执行深度自注意力,从而实现超越标准 Transformer 的真正长上下文密度估计。它在跨图像、书籍和音乐的长上下文基准测试中达到最先进或具竞争力的结果。

ABSTRACT

Real-world data is high-dimensional: a book, image, or musical performance can easily contain hundreds of thousands of elements even after compression. However, the most commonly used autoregressive models, Transformers, are prohibitively expensive to scale to the number of inputs and layers needed to capture this long-range structure. We develop Perceiver AR, an autoregressive, modality-agnostic architecture which uses cross-attention to map long-range inputs to a small number of latents while also maintaining end-to-end causal masking. Perceiver AR can directly attend to over a hundred thousand tokens, enabling practical long-context density estimation without the need for hand-crafted sparsity patterns or memory mechanisms. When trained on images or music, Perceiver AR generates outputs with clear long-term coherence and structure. Our architecture also obtains state-of-the-art likelihood on long-sequence benchmarks, including 64 x 64 ImageNet images and PG-19 books.

研究动机与目标

  • 激发并实现对具有非常长输入上下文的一般用途密度建模。
  • 开发一种自回归架构,通过潜在瓶颈将输入长度与计算解耦。
  • 展示在不同领域(图像、文本、音乐)中可以捕捉到长距离依赖。
  • 展示相对于传统解码器型 Transformer 和 Transformer-XL 的可扩展性优势。

提出的方法

  • 使用跨注意力将大型输入 X(M 个 token)映射到一个较小的潜在数组 Z(N 个潜在变量)。
  • 对潜在变量应用一系列因果屏蔽的自注意力,以为每个目标 token 产生输出。
  • 为每个目标分配一个潜在变量以保持自回归顺序,并在跨注意力和自注意力中应用因果屏蔽。
  • 在解耦输入长度的同时维持整体自回归因果性,复杂度近似为 O(MN) + O(LN^2)。
  • 在长上下文领域(图像、语言、音乐)上进行训练和评估,以展示长程连贯性和密度估计。

实验结果

研究问题

  • RQ1自回归模型是否能够在不需要高昂计算成本的情况下关注非常长的输入(例如 >10^4 token)?
  • RQ2通过潜在瓶颈解耦输入长度与自注意力深度是否能保留自回归依赖并提高可扩展性?
  • RQ3在多种模态(图像、文本、音乐)下是否对长上下文密度估计有效?
  • RQ4在规模化的表现和效率方面,Perceiver AR 相较于解码器-only Transformer 和 Transformer-XL 的表现如何?

主要发现

  • Perceiver AR 可以关注超过十万 Tokens 以进行长上下文密度估计。
  • 在 64×64 ImageNet 密度估计上,评估时增加潜在变量会在一定程度上提升 bits/dim,并实现测试时计算权衡。
  • 在 PG-19 语言建模中,Perceiver AR 超越了使用相同 tokenization 的先前自回归模型,并且能够随上下文长度扩展到成千上万的 token。
  • 在 Books(MassiveTest)和 Wikitext-103 上,Perceiver AR 的表现与 Transformer-XL 基线相当或超过,并且困惑度具有竞争力。
  • 在 MAESTRO 符号与音频任务中,Perceiver AR 的负对数似然低于之前的音乐生成模型,证明了长程连贯性。
  • 该模型通过在不重新训练的情况下改变潜在变量数量来支持灵活的测试时间计算,从而在不同预算下实现高效部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。