[논문 리뷰] Examining Forgetting in Continual Pre-training of Aligned Large Language Models
이 논문은 이미 피니터닝된 대규모 언어 모델의 연속적 프리트레이닝 중 치명적인 기억 상실(catastrophic forgetting) 현상을 조사한다. 특히 SFT와 RLHF로 피니터닝된 Llama-2-7b-chat 모델을 중심으로 다룬다. 중국어 고전어 자료를 활용한 연속적 프리트레이닝이 출력 형식, 지식 유지도, 신뢰성에 미치는 영향을 평가한 결과, 사실 지식은 유지되었음에도 불구하고 신뢰성이 떨어지고 반복 현상이 증가하는 것으로 나타났다. 이 연구는 표준 피니터닝 기법이 특히 생성 품질과 일관성 측면에서 기억 상실을 완화하지 못함을 입증한다.
Recent advances in Large Language Models (LLMs) have exhibited remarkable proficiency across various tasks. Given the potent applications of LLMs in numerous fields, there has been a surge in LLM development. In developing LLMs, a common practice involves continual pre-training on previously fine-tuned models. However, this can lead to catastrophic forgetting. In our work, we investigate the phenomenon of forgetting that occurs during continual pre-training on an existing fine-tuned LLM. We evaluate the impact of continuous pre-training on the fine-tuned LLM across various dimensions, including output format, knowledge, and reliability. Experiment results highlight the non-trivial challenge of addressing catastrophic forgetting during continual pre-training, especially the repetition issue.
연구 동기 및 목표
- 이미 피니터닝된 대규모 언어 모델에서 연속적 프리트레이닝 중 발생하는 치명적인 기억 상실 현상의 원인을 조사하는 것.
- 연속적 프리트레이닝이 출력 형식, 사실 지식, 신뢰성 등 다양한 차원에서 미치는 영향을 평가하는 것.
- 표준 피니터닝 및 매개변수 효율적 적응 방법(예: LoRA, 어댑터)이 정렬된 LLM에서 기억 상실을 효과적으로 완화할 수 있는지 평가하는 것.
- 중국어 고전어 텍스트를 생성하는 모델에서 반복 문제의 발생 원인을 분석하는 것.
- 연속적 프리트레이닝 이후 지식, 진실성, 독성, 편향 측면에서 모델 성능을 벤치마킹하는 것.
제안 방법
- 중국어 고전어 데이터 10억 토큰을 활용해 Llama-2-7b-chat에 대한 연속적 프리트레이닝을 수행하여 Llama-2-7b-chat-cp 모델을 도출함.
- MMLU, ARC, Hellaswag, C-eval-tw, TruthfulQA, ToxiGen, BOLD 등 다양한 벤치마크에서 제로샷 및 피샷 프롬프트를 사용한 평가.
- 정렬 기반 추론을 위한 [INST] 및 [/INST] 토큰화를 활용한 프롬프트 엔지니어링 적용.
- 추론 효율성을 높이기 위해 vLLM 사용 및 온도 0.1, top_p 0.9로 설정한 핵심 샘플링 기법 적용.
- 독성 및 편향 평가를 위해 모델 출력을 Google Translate API를 통해 영어로 번역하고, 영어 기반 분류기 활용.
- ToxiGen 분류기(기반: RoBERTa) 및 VADER 감성 분석기 도입을 통해 생성된 텍스트의 독성 및 편향 수준 평가.

실험 결과
연구 질문
- RQ1이미 피니터링된 LLM에서 연속적 프리트레이닝이 생성 신뢰성 및 형식 측면에서 치명적인 기억 상실을 어느 정도 유발하는가?
- RQ2연속적 프리트레이닝은 다국어 및 영역 특화 벤치마크에서 모델의 사실 지식 유지도에 어떤 영향을 미치는가?
- RQ3특히 중국어 고전어에서의 출력 형식은 반복 및 일관성 문제를 악화시키는 데 어떤 역할을 하는가?
- RQ4표준 피니터닝 또는 LoRA, 어댑터와 같은 매개변수 효율적 적응 방법이 정렬된 LLM에서 기억 상실을 효과적으로 완화할 수 있는가?
- RQ5연속적 프리트레이닝은 생성된 출력의 진실성, 독성, 편향에 어떤 영향을 미치는가?
주요 결과
- MMLU 및 ARC와 같은 벤치마크 측정 결과, Llama-2-7b-chat-cp 모델은 사실 지식은 유지하고 있음에도 불구하고 신뢰성에 심각한 하락을 보였다.
- 중국어 고전어를 생성하는 모델에서는 뚜렷한 반복 문제가 발생하여, 생성 품질에 형식 기반의 열악한 영향이 있음을 시사한다.
- MMLU 및 C-eval-tw에서의 안정된 성능을 바탕으로, 연속적 프리트레이닝 후 지식 유지도는 대부분 유지된 것으로 나타났다.
- ToxiGen 및 BOLD 벤치마크에서 독성 및 편향 수준은 변화 없거나 약간 증가했으며, 프리트레이닝 이후 유의미한 개선이 없었다.
- 표준 피니터닝 및 어댑터 기반 방법(LoRA, IAdapter)은 반복 문제를 완전히 억제하거나 신뢰성을 복원하지 못했으며, 이는 더 정교한 연속 학습 전략의 필요성을 시사한다.
- 연구 결과, 정렬 작업이 수행된 이후에도 연속적 프리트레이닝이 일관성 및 일관성 문제를 포함한 새로운 실패 유형을 유발함을 확인했으며, 이는 LLM 개발에서 기억 상실 문제의 비단순성에 대한 경고를 담고 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.