Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Continual Pre-training for Building Domain Specific Large Language Models

Yong Xie, Karan Aggarwal|arXiv (Cornell University)|2023. 11. 14.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 도메인 특화 대규모 언어 모델을 구축하기 위한 효율적인 지속적 사전 훈련 방법—ETS-DACP 및 ETA-DACP—을 제안하며, 선택적 데이터 코호트가 일반 도메인 능력을 유지하면서도 단지 원본 지속적 사전 훈련의 10% 데이터와 비용으로 금융 작업에서 성능을 향상시킨다는 것을 입증한다.

ABSTRACT

Large language models (LLMs) have demonstrated remarkable open-domain capabilities. LLMs tailored for a domain are typically trained entirely on domain corpus to excel at handling domain-specific tasks. In this work, we explore an alternative strategy of continual pre-training as a means to develop domain-specific LLMs over an existing open-domain LLM. We introduce FinPythia-6.9B, developed through domain-adaptive continual pre-training on the financial domain. Continual pre-trained FinPythia showcases consistent improvements on financial tasks over the original foundational model. We further explore simple but effective data selection strategies for continual pre-training. Our data selection strategies outperform vanilla continual pre-training's performance with just 10% of corpus size and cost, without any degradation on open-domain standard tasks. Our work proposes an alternative solution to building domain-specific LLMs cost-effectively.

연구 동기 및 목표

  • 금융과 같은 저데이터 도메인에서 도메인 적응형 지속적 사전 훈련이 고성능 도메인 특화 LLM을 효과적으로 구축할 수 있는지 조사하기 위해.
  • 도메인 특화 LLM을 새로 훈련하는 데 높은 비용과 데이터 비효율성이 존재하므로, 비용 효율적인 대안으로 지속적 사전 훈련을 탐색하기 위해.
  • 태스크 특화 데이터가 필요 없고 일반 도메인 성능을 훼손하지 않으면서도 지속적 사전 훈련의 효율성을 높이는 데이터 선택 전략을 개발하기 위해.
  • 지속적 사전 훈련이 표준 벤치마크에서 일반 언어 능력에 악영향을 미치는지 평가하기 위해.
  • 사전 훈련된 기초 모델과 타겟팅된 데이터 코호트 총괄을 사용하여 확장 가능하고 저비용의 도메인 특화 LLM 구축 파이프라인을 수립하기 위해.

제안 방법

  • 공개 자료에서 160억 단어에 이르는 대규모 금융 코퍼스를 수집: CommonCrawl를 통한 금융 뉴스 및 SEC 서류 제출 자료를 포함하며, 중복 제거를 통해 훈련 효율성을 향상시켰다.
  • 유사도, 퍼플렉서티, 토큰 유형 엔트로피를 사용하여 고가치 훈련 샘플을 선택하는 ETS-DACP(태스크 인식형) 및 ETA-DACP(태스크 무관형) 방법을 제안하여 지속적 사전 훈련에 활용하였다.
  • 기초 모델인 Pythia-6.9B에 선택된 금융 데이터를 기반으로 지속적 사전 훈련을 적용하여, 재훈련 없이 도메인 특화 분포에 맞게 미세조정하였다.
  • 세 가지 데이터 선택 메트릭스를 사용: (1) 태스크 데이터에 대한 의미적 유사도(ETS-DACP용), (2) 퍼플렉서티(ETS-DACP 및 ETA-DACP-ppl용), (3) 토큰 유형 엔트로피(ETA-DACP-ent용), 이로써 태스크 무관형 선택이 가능하도록 하였다.
  • 금융 벤치마크와 표준 일반 도메인 작업(예: MMLU, TruthfulQA)에서 성능을 평가하여 도메인 적응 능력과 성능 유지 여부를 점검하였다.
  • 기본 지속적 사전 훈련, ETS-DACP, ETA-DACP 변종 간 결과를 비교하여 전체 도메인 코퍼스의 10%를 사용함으로써 비용-성능 트레이드오프를 평가하였다.
Figure 1 : Labeled task data, task-similar domain data and domain corpus in a manifold space.
Figure 1 : Labeled task data, task-similar domain data and domain corpus in a manifold space.

실험 결과

연구 질문

  • RQ1원본 기초 모델 대비 도메인 적응형 지속적 사전 훈련이 금융 작업 성능을 효과적으로 향상시킬 수 있는가?
  • RQ2데이터 선택 전략이 지속적 사전 훈련의 비용과 데이터 볼륨을 크게 줄일 수 있으며, 기본 지속적 사전 훈련 대비 성능을 유지하거나 향상시킬 수 있는가?
  • RQ3도메인 데이터에서의 지속적 사전 훈련이 일반 도메인 표준 벤치마크에서 모델 성능에 심각한 악영향을 미치는가?
  • RQ4퍼플렉서티, 엔트로피와 같은 태스크 무관형 데이터 선택 메트릭스가 태스크 인식형 유사도 기반 선택 대비 얼마나 효과적인가?
  • RQ5지속적 사전 훈련이 모델이 최신 금융 도메인 지식을 습득하고 유지할 수 있도록 할 수 있는가?

주요 결과

  • 기존 Pythia 훈련 데이터 크기의 8%에 해당하는 데이터로 지속적 사전 훈련을 수행한 FinPythia-6.9B는 기초 Pythia 모델 대비 금융 벤치마크에서 일관된 성능 향상을 보였다.
  • ETS-DACP 및 ETA-DACP 방법은 전체 도메인 코퍼스의 10%만 사용함으로써 기본 지속적 사전 훈련을 능가하는 성능을 달성했으며, 비용과 데이터 볼륨을 크게 줄였다.
  • 퍼플렉서티와 엔트로피를 태스크 무관형 선택 기준으로 사용한 ETA-DACP는 태스크 인식형 ETS-DACP와 거의 유사한 성능을 보였으며, 레이블이 있는 태스크 데이터가 필요 없이 데이터 선택이 가능했다.
  • MMLU, TruthfulQA, HellaSwag와 같은 일반 도메인 벤치마크에서 유의미한 성능 저하가 관찰되지 않아, 지속적 사전 훈련이 일반 언어 능력을 유지한다는 점을 시사했다.
  • 정성적 분석을 통해 FinPythia는 최신 시장 및 규제 변화와 같은 최신 금융 지식을 효과적으로 습득하고 유지하고 있음을 확인했다.
  • 도메인 데이터의 10%만(23.9억 토큰)을 사용해 훈련한 모델이 금융 작업에서 최신 기술 수준의 성능을 달성하여, 데이터 효율성과 비용 절감이 성능 훼손 없이 달성 가능함을 입증했다.
Figure 2 : Training loss of FinPythia-6.9B. FinPythia-6.9B achieves significant loss drop in financial corpus at mild expense of Pile loss.
Figure 2 : Training loss of FinPythia-6.9B. FinPythia-6.9B achieves significant loss drop in financial corpus at mild expense of Pile loss.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.