Skip to main content
QUICK REVIEW

[논문 리뷰] General-purpose, long-context autoregressive modeling with Perceiver AR

Curtis Hawthorne, Andrew Jaegle|arXiv (Cornell University)|2022. 02. 15.
Generative Adversarial Networks and Image Synthesis인용 수 34
한 줄 요약

Perceiver AR은 cross-attention을 사용하여 매우 긴 입력을 작은 잠재 집합으로 압축하고 잠재 공간에서 깊은 self-attention을 수행함으로써 표준 트랜스포머를 넘어서는 진정한 긴 컨텍스트 밀도 추정을 가능하게 하는 autoregressive, modality-agnostic 아키텍처를 도입한다. 이는 이미지, 책, 음악에 걸친 긴 컨텍스트 벤치마크에서 최첨단 또는 경쟁력 있는 성과를 달성한다.

ABSTRACT

Real-world data is high-dimensional: a book, image, or musical performance can easily contain hundreds of thousands of elements even after compression. However, the most commonly used autoregressive models, Transformers, are prohibitively expensive to scale to the number of inputs and layers needed to capture this long-range structure. We develop Perceiver AR, an autoregressive, modality-agnostic architecture which uses cross-attention to map long-range inputs to a small number of latents while also maintaining end-to-end causal masking. Perceiver AR can directly attend to over a hundred thousand tokens, enabling practical long-context density estimation without the need for hand-crafted sparsity patterns or memory mechanisms. When trained on images or music, Perceiver AR generates outputs with clear long-term coherence and structure. Our architecture also obtains state-of-the-art likelihood on long-sequence benchmarks, including 64 x 64 ImageNet images and PG-19 books.

연구 동기 및 목표

  • 매우 긴 입력 컨텍스트를 갖는 일반 목적 밀도 모델링을 동기 부여하고 가능하게 한다.
  • 입력 길이를 잠재 병목을 통해 계산과 분리하는 autoregressive 아키텍처를 개발한다.
  • 다양한 도메인(이미지, 텍스트, 음악)에 걸쳐 장거리 의존성을 포착할 수 있음을 보인다.
  • 전통적인 디코더-전용 트랜스포머 및 Transformer-XL에 비해 확장성 우위를 시연한다.

제안 방법

  • 크로스 어텐션을 사용하여 큰 입력 X(M 토큰)를 작은 잠재 배열 Z(N 잠재)로 매핑한다.
  • 잠재에 대해 인과적으로 마스킹된 자기 주의를 적층적으로 적용하여 각 타깃 토큰에 대한 출력 을 생성한다.
  • 타깃당 하나의 잠재를 할당하여 autoregressive 순서를 보존하고 크로스 어텐션과 자기 주의에서 인과 마스킹을 적용한다.
  • 입력 길이에서 계산을 분리하면서도 전반적인 autoregressive 인과성을 유지하고 복잡도는 대략 O(MN) + O(LN^2)로 달성한다.
  • 긴 컨텍스트 도메인(이미지, 언어, 음악)에 대해 훈련하고 평가하여 장거리 일관성과 밀도 추정을 보여준다.

실험 결과

연구 질문

  • RQ1자동회귀 모델이 지나치게 큰 계산 없이 매우 긴 입력(예: >10^4 토큰)에 주의(attend)할 수 있는가?
  • RQ2잠재 병목을 통해 입력 길이를 자기 주의 깊이에 독립시키는 것이 autoregressive 의존성을 유지하고 확장성을 개선하는가?
  • RQ3다양한 모달리티(이미지, 텍스트, 음악)에 걸쳐 긴 컨텍스트 밀도 추정을 위한 이 접근법이 효과적인가?
  • RQ4대규모에서 성능과 효율성 측면에서 Perceiver AR은 decoder-only Transformers 및 Transformer-XL과 어떻게 비교되는가?

주요 결과

  • Perceiver AR은 긴 컨텍스트 밀도 추정을 위해 수십 만 토큰 이상에 주의를 기울일 수 있다.
  • 64×64 ImageNet 밀도 추정에서 평가 시 잠재를 늘리면 어느 정도까지 비트/디멘으로 향상되며 테스트 시 계산 trade-off를 가능하게 한다.
  • PG-19 언어 모델링에서 Perceiver AR는 동일한 토크나이제이션을 사용하는 기존 autoregressive 모델들보다 성능이 우수하며 컨텍스트 길이가 수천 토큰에 이를 때까지 확장된다.
  • Books (MassiveTest) 및 Wikitext-103에서 Perceiver AR은 Transformer-XL 베이스라인에 부합하거나 이를 능가하며 경쟁력 있는 perplexities를 보인다.
  • MAESTRO 기호 및 오디오 작업에서 Perceiver AR은 이전 음악 생성 모델들보다 더 낮은 음의 로그 가능도(nll)를 달성하여 장거리 일관성을 보여준다.
  • 모델은 재훈련 없이 잠재 수를 조정하여 테스트 시 계산을 유연하게 지원하므로 예산에 따라 효율적인 배치를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.