[논문 리뷰] At Which Training Stage Does Code Data Help LLMs Reasoning?
이 논문은 대규모 언어 모델(Large Language Models, LLMs)에서 코드 데이터가 언제 가장 효과적으로 추론 능력을 향상시키는지 조사한다. 결과적으로, 혼합된 코드-텍스트 데이터로 사전 훈련을 수행할 경우 일반적인 추론 능력이 크게 향상되며, 코드 데이터로 지시 훈련을 수행할 경우 작업별 추론 능력이 향상됨을 발견하였다. 동적 혼합 전략을 도입함으로써 단계적 추론 학습이 더욱 향상되었으며, 이는 효율적이고 추론 능력을 갖춘 LLM을 훈련하는 데 있어 핵심 통찰을 제공한다.
Large Language Models (LLMs) have exhibited remarkable reasoning capabilities and become the foundation of language technologies. Inspired by the great success of code data in training LLMs, we naturally wonder at which training stage introducing code data can really help LLMs reasoning. To this end, this paper systematically explores the impact of code data on LLMs at different stages. Concretely, we introduce the code data at the pre-training stage, instruction-tuning stage, and both of them, respectively. Then, the reasoning capability of LLMs is comprehensively and fairly evaluated via six reasoning tasks in five domains. We critically analyze the experimental results and provide conclusions with insights. First, pre-training LLMs with the mixture of code and text can significantly enhance LLMs' general reasoning capability almost without negative transfer on other tasks. Besides, at the instruction-tuning stage, code data endows LLMs the task-specific reasoning capability. Moreover, the dynamic mixing strategy of code and text data assists LLMs to learn reasoning capability step-by-step during training. These insights deepen the understanding of LLMs regarding reasoning ability for their application, such as scientific question answering, legal support, etc. The source code and model parameters are released at the link:~\url{https://github.com/yingweima2022/CodeLLM}.
연구 동기 및 목표
- 코드 데이터가 LLM의 추론 능력을 가장 효과적으로 향상시키는 훈련 단계를 특정하는 것.
- 다양한 도메인에서 일반적 추론과 작업별 추론에 대한 코드 데이터의 영향을 평가하는 것.
- 코드 데이터가 추론이 아닌 작업에서의 부정적 전이 또는 성능 저하를 유발하는지 분석하는 것.
- 훈련 중 코드 데이터와 텍스트 데이터 간의 동적 혼합 전략의 효과를 탐색하는 것.
- 추론 능력을 갖춘 LLM 연구를 지원하기 위해 오픈소스 모델과 코드를 제공하는 것.
제안 방법
- 일반 텍스트 데이터와 코드-텍스트 혼합 데이터로 사전 훈련하여 일반적 추론 능력 향상을 평가하는 방법.
- 일반 텍스트 데이터와 텍스트-코드 혼합 데이터로 지시 훈련을 수행하여 작업별 추론 능력 향상 여부를 평가하는 방법.
- 훈련 과정에서 점차적으로 코드 데이터 비율을 증가시키는 동적 혼합 전략을 적용하여 단계적 추론 학습을 시뮬레이션하는 방법.
- 논리적, 코드, 법적, 과학적, 유추적 추론의 다섯 도메인에서 여섯 가지 추론 작업을 통해 모델을 평가하는 방법.
- 모델 아키텍처와 훈련 목적이 동일한 제어 실험을 수행하여 공정한 비교를 보장하는 방법.
- 훈련된 모델 가중치와 코드를 배포하여 재현 가능성과 향후 연구를 지원하는 방법.
실험 결과
연구 질문
- RQ1코드 데이터가 사전 훈련, 지시 훈련, 또는 양쪽 단계에서 LLM의 추론 능력을 가장 효과적으로 향상시키는가?
- RQ2사전 훈련 단계에서 코드 데이터를 도입하면 추론이 아닌 작업에서의 부정적 전이가 발생하는가?
- RQ3지시 훈련 단계에서 코드 데이터를 사용하면 작업별 추론 벤치마크 성능이 향상되는가?
- RQ4훈련 중 코드 데이터와 텍스트 데이터의 동적 혼합 전략이 추론 능력에 어떤 영향을 미치는가?
- RQ5일상 지각이나 이해 작업에서 성능 저하 없이 코드 데이터가 추론 능력을 얼마나 향상시키는가?
주요 결과
- 코드와 텍스트의 혼합 데이터로 사전 훈련을 수행할 경우, 다양한 도메인에서 일반적 추론 능력이 크게 향상되며, 다른 작업에서는 최소한의 부정적 영향을 미친다.
- 코드 데이터로 지시 훈련을 수행할 경우, 특히 코드 및 논리적 추론 작업에서 작업별 추론 능력이 향상되어 지시에 더 잘 따르는 능력을 갖춘다.
- 훈련 중 코드 데이터와 텍스트 데이터의 동적 혼합 전략은 추론 능력의 단계적 학습을 촉진하여 모델의 일반화 능력을 향상시킨다.
- NLI 및 독해 이해(예: DuReader)와 같은 추론이 아닌 작업에서는 코드 데이터 도입이 거의 영향을 주지 않으며, 일부 작업에서는 약간의 성능 향상이 관찰된다.
- DuReader 작업에서는 코드 데이터 도입 시 성능이 약간 감소한 것으로 나타났는데, 이는 모델이 코드 패턴과 자연어 패턴을 혼동했을 가능성이 있으며, 더 큰 규모의 훈련이 필요할 수 있음을 시사한다.
- 본 연구는 코드 데이터가 추론 능력 향상에 핵심적인 역할을 하며, 사전 훈련 및 지시 훈련 단계에서 전략적으로 도입될 경우 최적의 영향을 미친다는 것을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.