[논문 리뷰] Galactica: A Large Language Model for Science
Galactica는 과학 지식을 저장, 결합 및 추론하도록 설계된 크고 큐레이션된 과학 언어 모델로, 다수의 과학 중심 작업에서 최신 성과를 달성하고 과학 데이터와의 다중 모달 상호작용을 가능하게 한다.
Information overload is a major obstacle to scientific progress. The explosive growth in scientific literature and data has made it ever harder to discover useful insights in a large mass of information. Today scientific knowledge is accessed through search engines, but they are unable to organize scientific knowledge alone. In this paper we introduce Galactica: a large language model that can store, combine and reason about scientific knowledge. We train on a large scientific corpus of papers, reference material, knowledge bases and many other sources. We outperform existing models on a range of scientific tasks. On technical knowledge probes such as LaTeX equations, Galactica outperforms the latest GPT-3 by 68.2% versus 49.0%. Galactica also performs well on reasoning, outperforming Chinchilla on mathematical MMLU by 41.3% to 35.7%, and PaLM 540B on MATH with a score of 20.4% versus 8.8%. It also sets a new state-of-the-art on downstream tasks such as PubMedQA and MedMCQA dev of 77.6% and 52.9%. And despite not being trained on a general corpus, Galactica outperforms BLOOM and OPT-175B on BIG-bench. We believe these results demonstrate the potential for language models as a new interface for science. We open source the model for the benefit of the scientific community.
연구 동기 및 목표
- 과학 지식의 저장, 결합, 추론이 가능한 LLM을 만들어 과학 분야의 정보 과부하를 해결하고 동기를 부여한다.
- LaTeX, SMILES, 아미노산, DNA 등 다양한 모달리티와 상호 작용하기 위한 큐레이션된 규범적 과학 말뭉치와 전문 인터페이스를 개발한다.
- 지식 집약적 과학 작업 및 추론 벤치마크에서 최신 성능을 입증한다.
- 큐레이션된 데이터셋의 반복 토큰이 상류 및 하류 성능 모두를 향상시킬 수 있는지 탐구한다.
제안 방법
- 106B-token 큐레이션된 과학 말뭉치에 대해 디코더 전용 Transformer(GeLU 활성화, 2048 컨텍스트 윈도우, 바이어스 없음, 학습된 위치 임베딩)를 학습한다.
- 인용, 추론 작업 메모리, SMILES, 아미노산, DNA 서열용의 전문 토큰과 함께 5만 토큰 BPE 어휘를 사용한다.
- 화학적 성질, QA, 요약, 추론 등과 같은 작업 특화 신호를 강화하기 위해 일반 데이터와 함께 프롬프트 혼합으로 사전 학습한다.
- 지식 프로브(LaTeX 방정식, 도메인 프로브) 및 다운스트림 작업(PubMedQA, MedMCQA, MMLU, MATH)을 통해 지식, 추론 및 다중 모달 역량을 벤치마킹하기 위해 평가한다.
실험 결과
연구 질문
- RQ1큐레이션된 규범적 과학 말뭉치가 디코더 전용 LLM이 과학 지식을 효과적으로 저장하고 추론하게 만들 수 있는가?
- RQ2큐레이션된 데이터셋의 반복 토큰이 상류 학습 손실과 하류의 과학적 성능에 어떤 영향을 미치는가?
- RQ3사전 학습 중 작업 컨텍스트 프롬프트가 일반성을 해치지 않으면서 과학 및 비과학적 작업의 성능을 향상시키는가?
- RQ4하나의 모델 내에서 LaTeX, SMILES, 아미노산 서열, DNA와 같은 모달리티를 얼마나 학습하고 활용할 수 있는가?
- RQ5일반 LLM과 비교했을 때 지식 집약 벤치마크 및 전문 다운스트림 작업에서 Galactica의 성능은 어떠한가?
주요 결과
- 120B 모델에서 반복 토큰은 검증 손실과 하류 성능을 네 에폭까지 지속해서 향상시키며, 가장 큰 모델은 초반 과적합을 에폭 다섯 근처에서만 보였다.
- LaTeX 방정식 지식은 규모에 따라 향상되며, 120B가 LaTeX 방정식 프로브에서 68.2%를 달성하고 GPT-3의 49.0%를 상회한다.
- Galactica는 PubMedQA(77.6%) 및 MedMCQA dev(52.9%)에서 최신 성능을 달성한다.
- 추론 벤치마크에서 Galactica는 MMLU에서 Chinchilla(41.3% vs 35.7%)를 능가하고 PaLM 540B의 MATH(20.4% vs 8.8%)에서 우수하다.
- 일반 말뭉치로 학습되지 않았음에도 Galactica는 BIG-bench에서 BLOOM과 OPT-175B를 앞서며 SMILES와 아미노산 서열로 다중 모달 능력을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.