[논문 리뷰] DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence
DeepSeek-Coder-V2는 오픈 소스 Mixture-of-Experts 코드 모델(16B 및 236B)로 코드와 수학 과제에서 비공개 모델에 근접하거나 그 이상을 달성하고, 언어 지원을 338개 언어로 확장하며 컨텍스트 길이를 128K 토큰으로 증가시킵니다.
We present DeepSeek-Coder-V2, an open-source Mixture-of-Experts (MoE) code language model that achieves performance comparable to GPT4-Turbo in code-specific tasks. Specifically, DeepSeek-Coder-V2 is further pre-trained from an intermediate checkpoint of DeepSeek-V2 with additional 6 trillion tokens. Through this continued pre-training, DeepSeek-Coder-V2 substantially enhances the coding and mathematical reasoning capabilities of DeepSeek-V2, while maintaining comparable performance in general language tasks. Compared to DeepSeek-Coder-33B, DeepSeek-Coder-V2 demonstrates significant advancements in various aspects of code-related tasks, as well as reasoning and general capabilities. Additionally, DeepSeek-Coder-V2 expands its support for programming languages from 86 to 338, while extending the context length from 16K to 128K. In standard benchmark evaluations, DeepSeek-Coder-V2 achieves superior performance compared to closed-source models such as GPT4-Turbo, Claude 3 Opus, and Gemini 1.5 Pro in coding and math benchmarks.
연구 동기 및 목표
- 오픈 소스 코드 모델과 선도 비공개 모델(GPT-4-Turbo 등) 간의 격차를 코드 작성 및 수학 과제에서 좁히는 것.
- 다양한 프로그래밍 언어와 장거리 코드 이해를 지원하기 위해 언어 및 컨텍스트 범위를 확장.
- 다원 소스 사전 학습, 긴 컨텍스트 학습, RL 기반 정렬을 통해 코딩 및 수학적 추론을 향상.
- 연구 및 무제한 상용 사용을 가능하게 하기 위해 관대한 라이선스 하에 오픈 소스 모델을 공개.
제안 방법
- DeepSeek-V2 중간 체크포인트에서 추가로 6 trillion 토큰을 사용한 연속 사전 학습으로, 코드, 수학, 자연어 도메인에서 총 10.2 trillion 학습 토큰의 데이터를 확보.
- 코드 말뭉치를 86개에서 338개 프로그래밍 언어로 확장하고 코드 토큰을 1,170B로 늘렸으며, 구성에서 60% 코드, 10% 수학, 30% 자연어.
- Yarn 프레임워크를 사용하여 16K에서 128K 토큰으로 extended 컨텍스트 길이를 확장하고, 단계적 장기 컨텍스트 학습을 수행.
- 두 단계 정렬: 코드, 수학 및 일반 데이터를 결합한 지시 데이터 세트에 대한 감독 미세 조정 후, 컴파일러/테스트 케이스 피드백으로 조정된 보상 모델을 사용한 GRPO(Group Relative Policy Optimization) 방식의 강화 학습.
- 16B의 경우 코드 완성을 강화하기 위해 Fill-In-Middle(FIM) 학습(Prefix-Suffix-Middle 구조)을 활용; 236B의 경우 Next-Token-Prediction 목표에 의존.
- 코딩, 수학, NL 작업 전반에서 개방형(Open-) 및 비공개 소스(Baselines)와 비교하여 성능 향상을 검증.

실험 결과
연구 질문
- RQ1오픈 소스 Mixture-of-Experts 코드 모델이 코드 작성 및 수학 벤치마크에서 비공개 리더와 동등하거나 능가할 수 있는가?
- RQ2프로그램 언어 커버리지 및 컨텍스트 길이 확장이 코딩 정확도와 추론 능력에 어떤 영향을 주는가?
- RQ3데이터 구성, 긴 컨텍스트 학습, RL-정렬 전략이 오픈 소스 코드 모델의 성능에 어떤 영향을 미치는가?
- RQ4오픈 소스 모델이 코드와 수학 과제에 특화되더라도 일반 언어 능력을 어느 정도 유지할 수 있는가?
주요 결과
- DeepSeek-Coder-V2 (236B)가 코드 및 수학 벤치마크에서 GPT-4-Turbo, Claude 3 Opus, Gemini 1.5 Pro에 상응하거나 그 이상을 달성.
- 코드 벤치마크는 236B 모델에서 HumanEval 90.2%, MBPP 76.2%(EvalPlus 파이프라인)이며 LiveCodeBench에서 43.4%.
- 수학 과제에서 DeepSeek-Coder-V2는 MATH에서 75.7%에 도달하여 GPT-4o와 거의 일치하고 AIME 2024 및 관련 데이터 세트에서 다수의 비공개 모델보다 우수하다.
- 이 모델은 338개의 프로그래밍 언어와 최대 128K 토큰의 컨텍스트 길이를 지원하며, 이전 연구의 86개 언어 및 16K 컨텍스트에서 확장되었다.
- 오픈 소스 DeepSeek-Coder-V2-Instruct는 HumanEval/MBPP의 결합 언어에서 평균 75.3%를 달성하여 제시된 벤치마크 세트에서 GPT-4o에 이어 두 번째로 높다.
- 장기 컨텍스트 및 FIM 활성화 변형(16B)은 강력한 코드 완성 및 수리 능력을 보여주며, FIM 작업 및 수리 벤치마크에서 두드러진 결과를 보인다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.