Skip to main content
QUICK REVIEW

[논문 리뷰] Hyena Hierarchy: Towards Larger Convolutional Language Models

Michael Poli, Stefano Massaroli|arXiv (Cornell University)|2023. 02. 21.
Topic Modeling인용 수 75
한 줄 요약

Hyena는 암시적 긴 컨볼루션의 재귀와 게이팅으로 구성된 서제곱의 주의력 없는 연산자를 제시하여 긴 문맥에서 Transformer와 유사한 언어 모델링 품질을 더 낮은 계산량과 빠른 추론으로 달성한다.

ABSTRACT

Recent advances in deep learning have relied heavily on the use of large Transformers due to their ability to learn at scale. However, the core building block of Transformers, the attention operator, exhibits quadratic cost in sequence length, limiting the amount of context accessible. Existing subquadratic methods based on low-rank and sparse approximations need to be combined with dense attention layers to match Transformers, indicating a gap in capability. In this work, we propose Hyena, a subquadratic drop-in replacement for attention constructed by interleaving implicitly parametrized long convolutions and data-controlled gating. In recall and reasoning tasks on sequences of thousands to hundreds of thousands of tokens, Hyena improves accuracy by more than 50 points over operators relying on state-spaces and other implicit and explicit methods, matching attention-based models. We set a new state-of-the-art for dense-attention-free architectures on language modeling in standard datasets (WikiText103 and The Pile), reaching Transformer quality with a 20% reduction in training compute required at sequence length 2K. Hyena operators are twice as fast as highly optimized attention at sequence length 8K, and 100x faster at sequence length 64K.

연구 동기 및 목표

  • 확대 시 주의력과 동일한 품질을 달성할 수 있는 서제곱 연산자 탐색 동기를 제시한다.
  • 게이팅이 포함된 긴 컨볼루션 기반의 데이터-제어 연산자로 Hyena를 도입한다.
  • Hyena가 언어 모델링과 긴 문맥이 필요한 작업에서 주의력과의 성능 격차를 줄임을 보여준다.
  • Hyena의 긴 시퀀스 및 비전 작업에서의 효율성 이점을 시연한다.
  • 벤치마크와 데이터셋 전반에 걸친 Hyena의 확장성 및 일반성을 평가한다.

제안 방법

  • Hyena를 데이터 제어된 연산자를 형성하기 위해 다중 곱셈 게이팅이 간헐적으로 들어간 긴 컨볼루션의 재귀로 정의한다.
  • 긴 컨볼루션을 학습 가능한 필터를 사용한 신경망 암시 표현(FFN-based windows)을 통해 암시적으로 매개화한다.
  • FFT 기반의 빠른 컨볼루션을 사용하여 O(L log L) 계산으로 연산자 전체를 구체화하지 않고 Hyena를 평가한다.
  • 자 autocausal 설정에서 인과적 컨볼루션 및 패딩 전략을 사용하여 인과성을 보장한다.
  • 연관 기억, 언어 모델링, 비전 작업 전반에서 Hyena를 최첨단 서제곱 방법과 비교한다.
  • 매우 긴 시퀀스에서 속도 향상을 정량화하기 위해 주의력 및 FlashAttention과 런타임을 벤치마크한다.

실험 결과

연구 질문

  • RQ1서제곱이면서 주의력 없는 연산자가 규모에 따라 dense 주의력과 비슷한 품질을 달성할 수 있는가?
  • RQ2데이터-제어 긴 컨볼루션 기반 아키텍처가 긴 문맥 추론 작업에서 성능 격차를 어느 정도 좁히는가?
  • RQ3긴 컨볼루션의 다양한 암시적 매개화가 확장성, 메모리 및 정확도에 어떤 영향을 미치는가?
  • RQ4Hyena의 긴 시퀀스에서 주의력 기반 방법에 비해 효율성과 속도 향상은 어떠한가?
  • RQ5Hyena가 언어 작업을 넘어 대규모 이미지 분류에서도 효과적인가?

주요 결과

  • Hyena는 The Pile에서 Transformer 기반 모델과 유사한 혼란도(perplexity)와 다운스트림 성능을 보이며 시퀀스 길이 2K에서 총 FLOP가 20% 감소하였다.
  • Hyena는 시퀀스 길이가 8K에서 64K로 증가할 때 밀집 주의력 대비 최대 5배에서 100배까지 속도 향상을 달성한다.
  • 335M 매개변수의 The Pile에서 Hyena는 20% FLOP 감소로 Transformer의 혼잡도와 유사한 성능을 달성한다.
  • Hyena는 WikiText103 및 The Pile에서 주의력과 하이브리드화 없이 서제곱 계산으로 Transformer와 유사한 품질에 도달한다.
  • 이미지 분류에서 Hyena는 attention 계층을 대체할 때 ImageNet-1k에서 주의력 기반 ViT 성능에 도달한다.
  • 긴 연상 회상 작업 전반에서 암시적 매개화가 다른 긴 컨볼루션 접근법보다 우수하며, 더 긴 시퀀스와 더 큰 어휘에서 더 큰 이점을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.