[논문 리뷰] In Search of Needles in a 11M Haystack: Recurrent Memory Finds What LLMs Miss
본 논문은 ultra-long 문서용 BABILong 벤치마크를 도입하고 순환 메모리 트랜스포머(RMT/RMT-R)가 최대 11 million tokens까지 처리 가능하며 긴 컨텍스트 작업에서 GPT-4 및 RAG를 능가한다는 것을 보여준다.
This paper addresses the challenge of processing long documents using generative transformer models. To evaluate different approaches, we introduce BABILong, a new benchmark designed to assess model capabilities in extracting and processing distributed facts within extensive texts. Our evaluation, which includes benchmarks for GPT-4 and RAG, reveals that common methods are effective only for sequences up to $10^4$ elements. In contrast, fine-tuning GPT-2 with recurrent memory augmentations enables it to handle tasks involving up to $11 imes 10^6$ elements. This achievement marks a substantial leap, as it is by far the longest input processed by any neural network model to date, demonstrating a significant improvement in the processing capabilities for long sequences.
연구 동기 및 목표
- 현재 능력을 넘어서는 매우 긴 컨텍스트에서 NLP 모델을 평가할 필요성을 동기화한다.
- 분산된 사실들로 긴 컨텍스트 QA를 위한 확장 가능한 벤치마크(BABILong)를 제안한다.
- GPT-4, RAG, 그리고 초장문 입력에서의 재현 가능한 메모리 보강 트랜스포머를 평가한다.
- 재귀성과 자기-회수를 통한 재현이 기존 모델들을 넘어서는 컨텍스트 처리 능력을 확장시킬 수 있음을 입증한다.
제안 방법
- PG19/Wiki의 배경 텍스트 속에 문장을 숨겨 초장문 컨텍스트 벤치마크 BABILong를 소개한다.
- GPT-4-Turbo (128k window)와 Mistral (32k window)을 사용해 컨텍스트 크기가 커질 때 기본 LLM 성능을 평가한다.
- 16k-token 태스크에서 GPT-3.5를 미세조정하고 컨텍스트 확장으로 성능을 평가한다.
- Long sequences를 선형 확장으로 처리하기 위해 Recurrent Memory Transformer (RMT)와 RMT with self-retrieval (RMT-R)을 구현한다.
- 과거 메모리 상태의 검색을 통해 past segments에 대한 attention 유사 접근을 모방하도록 RMT/RMT-R를 확장한다.
- 입력을 512-token 청크로 분할하고 세그먼트 간 메모리 토큰을 유지하며 주의/메모리 사용을 분석한다.
- RAG를 GPT-4와 함께 메모리 확장 접근 방식과 비교하기 위해 FAISS/LangChain을 사용한 임베딩(text-embedding-ada-002)을 활용한다.
실험 결과
연구 질문
- RQ1현재 LLM들이 컨텍스트 길이가 10^4–10^5 토큰으로 증가하면서 바늘 속의 헤이스트랙 문제를 해결할 수 있는가?
- RQ2검색-강화 및 메모리-강화 아키텍처가 표준 주의가 비효율적이 되는 초장문 컨텍스트에서 성능을 유지하는가?
- RQ3RMT와 RMT-R은 시퀀스 길이가 증가함에 따라 어떻게 확장되며, 긴 컨텍스트 QA에서 GPT-4 및 RAG와 어떻게 비교되는가?
- RQ4매우 긴 문서에서 다중 호 조건 추론에 대한 기억 기반 검색의 영향은 무엇인가?
- RQ5재귀적 기억 접근이 극도로 긴 시퀀스(수백만 토큰)에 대해 대형 LLM보다 우수한 레짐이 존재하는가?
주요 결과
- GPT-4 및 Mistral의 성능은 컨텍스트 길이가 증가함에 따라 저하되며, 큰 윈도우를 사용하더라도 마찬가지이다.
- RMT 및 RMT-R은 긴 시퀀스에서 GPT-4보다 훨씬 우수하며 실험에서 최대 11 million tokens를 처리할 수 있다.
- 메모리 상태 검색이 포함된 RMT-R은 과거 상태를 검색하여 추가적인 개선을 낳고 매우 긴 입력에서도 성능을 유지한다.
- RAG의 검색 강화는 BABILong 태스크에 대해 제한적이거나 태스크 의존적 이점을 보이며 특정 장문 컨텍스트 설정에서 메모리 기반 방법보다 비효율적일 수 있다.
- 메모리 기반 메커니즘으로 학습된 모델은 훈련 horizon(128k tokens까지 및 그 이상) 을 훨씬 넘어서는 시퀀스 길이에 일반화하는 지속적인 성능을 보이며, RMT-R은 10M+ tokens까지도 보조를 맞춘다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.