[논문 리뷰] Large Language Models: A Survey
GPT, LLaMA, PaLM 계열을 포함한 대형 언어 모델(LLMs)에 대한 포괄적 조사로, 학습/데이터, 평가, 보강, 데이터셋, 벤치마크 및 열려있는 과제들을 다룬다.
Large Language Models (LLMs) have drawn a lot of attention due to their strong performance on a wide range of natural language tasks, since the release of ChatGPT in November 2022. LLMs' ability of general-purpose language understanding and generation is acquired by training billions of model's parameters on massive amounts of text data, as predicted by scaling laws \cite{kaplan2020scaling,hoffmann2022training}. The research area of LLMs, while very recent, is evolving rapidly in many different ways. In this paper, we review some of the most prominent LLMs, including three popular LLM families (GPT, LLaMA, PaLM), and discuss their characteristics, contributions and limitations. We also give an overview of techniques developed to build, and augment LLMs. We then survey popular datasets prepared for LLM training, fine-tuning, and evaluation, review widely used LLM evaluation metrics, and compare the performance of several popular LLMs on a set of representative benchmarks. Finally, we conclude the paper by discussing open challenges and future research directions.
연구 동기 및 목표
- 통계적 접근 방식에서 트랜스포머 기반 LLM으로의 언어 모델 진화를 요약하고 그들의 출현 능력을 다룬다.
- 세 가지 주요 LLM 계열(GPT, LLaMA, PaLM)과 주목할 만한 오픈 소스/오픈 액세스 모델들을 검토한다.
- RLHF와 지시 학습을 포함한 LLM 구축, 미세 조정, 보강 방법론을 개괄한다.
- LLM의 학습, 미세 조정 및 벤치마킹에 사용된 데이터세트와 평가 지표를 체계적으로 정리한다.
- LLM 개발 및 배치에서의 도전과제와 향후 연구 방향을 강조한다.
제안 방법
- 언어 모델링의 역사적 흐름(통계적, 신경망, 사전 학습, LLM)들을 고찰한다.
- 맥락 내 학습, 지시 이행, 다단계 추론 등 LLM의 능력을 특징짓는다.
- GPT, LLaMA, PaLM 계열 및 변이형과 오픈 소스 노력들을 비교한다.
- 사전 학습과 미세 조정 패러다임 및 보강 기법(RLHF, 외부 도구)을 설명한다.
- LLM의 학습 및 평가에 사용된 데이터세트와 벤치마크를 요약한다.

실험 결과
연구 질문
- RQ1현재 LLM 계열(GPT, LLaMA, PaLM)의 주요 능력과 한계는 무엇인가?
- RQ2학습 데이터, 모델 규모, 아키텍처가 벤치마크에서의 LLM 성능에 어떤 영향을 미치는가?
- RQ3도구 보강 및 정렬 기술이 LLM의 유용성, 안전성, 신뢰성을 어떻게 향상시키는가?
- RQ4다양한 작업에서 LLM을 평가하기 위해 표준으로 사용되는 데이터세트와 지표는 무엇인가?
- RQ5LLM 연구에서의 주요 열린 과제와 향후 방향은 무엇인가?
주요 결과
- LLMs은 맥락 내 학습, 지시 이행, 다단계 추론 등 출현 능력을 보여준다.
- 세 가지 주요 LLM 계열(GPT, LLaMA, PaLM)은 개방성, 규모, 성능에서 서로 다른 트레이드오프를 보여준다.
- 지시 튜닝과 RLHF 데이터가 정렬 및 작업 성능에 크게 영향을 준다.
- LLM의 학습, 미세 조정 및 평가를 지원하는 방대한 데이터세트와 벤치마크 생태계가 있다.
- 외부 도구, 검색, 연속 학습 등 다양한 보강 전략은 LLM 기반 에이전트를 가능하게 한다.
- 이 분야는 확장성, 안전성, 일반화에서의 열린 도전과제와 향후 연구 방향을 식별한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.