[논문 리뷰] InstructRetro: Instruction Tuning post Retrieval-Augmented Pretraining
이 논문은 1.2조 토큰의 데이터베이스에서 검색을 통한 보강된 사전학습을 통해 훈련된 480억 파라미터의 지시 미세조정 언어 모델인 InstructRetro를 소개한다. 1.2조 토큰의 외부 토큰에 대한 검색을 통해 430억 파라미터의 GPT 기반 모델을 미세조정함으로써, InstructRetro는 짧은 형식의 질의응답에서 GPT 기반 모델 대비 7% 높은 제로샷 정확도를 달성하고, 긴 형식의 질의응답에서는 10%, 요약 작업에서는 16% 향상된 성능을 보이며, 이는 검색 보강 사전학습이 대규모 환경에서도 지시 미세조정 성능을 크게 향상시킬 수 있음을 시사한다.
Pretraining auto-regressive large language models~(LLMs) with retrieval demonstrates better perplexity and factual accuracy by leveraging external databases. However, the size of existing pretrained retrieval-augmented LLM is still limited (e.g., Retro has 7.5B parameters), which limits the effectiveness of instruction tuning and zero-shot generalization. In this work, we introduce Retro 48B, the largest LLM pretrained with retrieval. Specifically, we continue to pretrain a 43B GPT model on additional 100 billion tokens using the Retro augmentation method by retrieving from 1.2 trillion tokens. Notably, the obtained foundation model, Retro 48B, largely outperforms the counterpart GPT 43B trained on 1.2T tokens in terms of perplexity with only 2.58% additional GPU hours, demonstrating the significant scaling potential of the method. After instruction tuning on Retro, InstructRetro demonstrates significant improvement over the instruction tuned GPT on a wide range of zero-shot tasks. Specifically, the average improvement of InstructRetro is 7% over its GPT counterpart across 8 short-form QA and reading comprehension tasks, 10% over GPT across 4 challenging long-form QA tasks, and 16% over GPT across 3 summarization tasks. Surprisingly, we find that one can ablate the encoder from InstructRetro architecture and directly use its decoder backbone, while achieving comparable results. Our results highlight the promising direction to obtain a better GPT decoder through continued pretraining with retrieval before instruction tuning. Our code and checkpoints are publicly available at: https://huggingface.co/nvidia/retro-48b-instruct-4k.
연구 동기 및 목표
- 현재 100억 파라미터 이론의 한계를 초월해 검색 보강 언어 모델을 확장하여, 더 나은 제로샷 일반화 능력과 지시 따르기 능력을 향상시키는 것.
- 지시 미세조정 이전에 검색을 통한 계속 학습이 대규모 언어 모델의 기초를 향상시키는지 조사하는 것.
- 지시 미세조정 이후 검색 보강 모델의 인코더 구성 요소가 최종 성능에 필수적인지 평가하는 것.
- 검색 보강 사전학습 이후 지시 미세조정을 통해 기존의 RAG나 검색 없이 미세조정된 모델에 비해 더 뛰어난 사실 정확도와 맥락 이해 능력을 확보할 수 있음을 입증하는 것.
제안 방법
- 1.2조 토큰의 데이터베이스에서 검색을 통한 생성(Retro) 방식을 사용해 1000억 개의 추가 토큰으로 430억 파라미터의 GPT 모델을 계속 학습함.
- 기존의 Retro 방법에서와 달리, 계속 학습 중 디코더 가중치를 동결하지 않고 해제하여 모든 파라미터를 함께 최적화함.
- 결과적으로 생성된 검색 보강 기초 모델(Retro 480억)에 지시 미세조정을 적용하여 InstructRetro 480억을 도출함으로써 지시 따르기 능력을 향상시킴.
- 아키텍처의 필수성 테스트를 위해 InstructRetro 480억에서 인코더를 제거하여 디코더 전용 InstructRetro 430억 모델을 생성함.
- 표준 평가 지표인 EM과 ROUGE를 사용해 제로샷 질의응답, 요약, 독해력 평가 작업에서 성능을 평가함.
- 두 단계 훈련 파이프라인을 사용: 먼저 검색 보강 사전학습을 수행하고, 그 다음에 정제된 지시 데이터를 사용해 지시 미세조정을 수행함.

실험 결과
연구 질문
- RQ11.2조 토큰 규모의 검색 보강 사전학습이 지시 미세조정 이전에 대규모 언어 모델의 성능을 크게 향상시킬 수 있는가?
- RQ2특히 디코더를 동결하지 않고 계속 학습할 경우, 기존 사전학습 대비 더 낮은 퍼플렉서티와 더 나은 제로샷 일반화 성능을 달성할 수 있는가?
- RQ3지시 미세조정은 사실 정확도와 추론 능력 측면에서 검색 보강 사전학습의 이점을 얼마나 강화하는가?
- RQ4InstructRetro와 같은 검색 보강 모델에서 인코더 구성 요소는 지시 미세조정 이후 높은 성능을 내기 위해 필수적인가?
- RQ5InstructRetro에서 파생된 디코더 전용 모델이 전체 모델과 유사한 성능을 달성할 수 있는가? 이는 더 효율적인 지시 미세조정 LLM 개발의 길을 제시할 수 있다.
주요 결과
- InstructRetro 480억은 8개의 짧은 형식의 질의응답 및 독해력 평가 작업에서 GPT 430억 기반 모델 대비 평균 제로샷 EM 정확도가 7% 높음.
- 4개의 도전적인 긴 형식의 질의응답 작업에서 InstructRetro 480억은 GPT 430억 기반 모델 대비 제로샷 평가에서 10% 향상된 성능 기록.
- 3개의 요약 작업에서 InstructRetro 480억은 GovReport에서 ROUGE 점수를 4.87점 향상시키며, Instruct GPT-RAG 700억 모델을 일관되게 능가함.
- 인코더를 제거한 디코더 전용 InstructRetro 430억은 전체 InstructRetro 480억과 유사한 성능을 기록함으로써, 지시 미세조정 이후 인코더가 필수적이지 않음을 시사함.
- Retro 480억은 단지 2.58%의 추가 GPU 시간만으로 GPT 430억 기반 모델 대비 더 낮은 퍼플렉서티를 달성함으로써, 검색 보강 사전학습의 확장성과 효율성을 입증함.
- 지시 미세조정은 GPT와 Retro 모델 양쪽 모두에서 지시 따르기의 한계를 크게 완화하며, 특히 사전학습 이후에 검색의 이점이 더 두드러지게 드러남.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.