Skip to main content
QUICK REVIEW

[논문 리뷰] DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence

DeepSeek-AI, Qihao Zhu|arXiv (Cornell University)|2024. 06. 17.
vaccines and immunoinformatics approaches인용 수 48
한 줄 요약

DeepSeek-Coder-V2는 오픈 소스 Mixture-of-Experts 코드 모델(16B 및 236B)로 코드와 수학 과제에서 비공개 모델에 근접하거나 그 이상을 달성하고, 언어 지원을 338개 언어로 확장하며 컨텍스트 길이를 128K 토큰으로 증가시킵니다.

ABSTRACT

We present DeepSeek-Coder-V2, an open-source Mixture-of-Experts (MoE) code language model that achieves performance comparable to GPT4-Turbo in code-specific tasks. Specifically, DeepSeek-Coder-V2 is further pre-trained from an intermediate checkpoint of DeepSeek-V2 with additional 6 trillion tokens. Through this continued pre-training, DeepSeek-Coder-V2 substantially enhances the coding and mathematical reasoning capabilities of DeepSeek-V2, while maintaining comparable performance in general language tasks. Compared to DeepSeek-Coder-33B, DeepSeek-Coder-V2 demonstrates significant advancements in various aspects of code-related tasks, as well as reasoning and general capabilities. Additionally, DeepSeek-Coder-V2 expands its support for programming languages from 86 to 338, while extending the context length from 16K to 128K. In standard benchmark evaluations, DeepSeek-Coder-V2 achieves superior performance compared to closed-source models such as GPT4-Turbo, Claude 3 Opus, and Gemini 1.5 Pro in coding and math benchmarks.

연구 동기 및 목표

  • 오픈 소스 코드 모델과 선도 비공개 모델(GPT-4-Turbo 등) 간의 격차를 코드 작성 및 수학 과제에서 좁히는 것.
  • 다양한 프로그래밍 언어와 장거리 코드 이해를 지원하기 위해 언어 및 컨텍스트 범위를 확장.
  • 다원 소스 사전 학습, 긴 컨텍스트 학습, RL 기반 정렬을 통해 코딩 및 수학적 추론을 향상.
  • 연구 및 무제한 상용 사용을 가능하게 하기 위해 관대한 라이선스 하에 오픈 소스 모델을 공개.

제안 방법

  • DeepSeek-V2 중간 체크포인트에서 추가로 6 trillion 토큰을 사용한 연속 사전 학습으로, 코드, 수학, 자연어 도메인에서 총 10.2 trillion 학습 토큰의 데이터를 확보.
  • 코드 말뭉치를 86개에서 338개 프로그래밍 언어로 확장하고 코드 토큰을 1,170B로 늘렸으며, 구성에서 60% 코드, 10% 수학, 30% 자연어.
  • Yarn 프레임워크를 사용하여 16K에서 128K 토큰으로 extended 컨텍스트 길이를 확장하고, 단계적 장기 컨텍스트 학습을 수행.
  • 두 단계 정렬: 코드, 수학 및 일반 데이터를 결합한 지시 데이터 세트에 대한 감독 미세 조정 후, 컴파일러/테스트 케이스 피드백으로 조정된 보상 모델을 사용한 GRPO(Group Relative Policy Optimization) 방식의 강화 학습.
  • 16B의 경우 코드 완성을 강화하기 위해 Fill-In-Middle(FIM) 학습(Prefix-Suffix-Middle 구조)을 활용; 236B의 경우 Next-Token-Prediction 목표에 의존.
  • 코딩, 수학, NL 작업 전반에서 개방형(Open-) 및 비공개 소스(Baselines)와 비교하여 성능 향상을 검증.
Figure 1: The Performance of DeepSeek-Coder-V2 on math and code benchmarks.
Figure 1: The Performance of DeepSeek-Coder-V2 on math and code benchmarks.

실험 결과

연구 질문

  • RQ1오픈 소스 Mixture-of-Experts 코드 모델이 코드 작성 및 수학 벤치마크에서 비공개 리더와 동등하거나 능가할 수 있는가?
  • RQ2프로그램 언어 커버리지 및 컨텍스트 길이 확장이 코딩 정확도와 추론 능력에 어떤 영향을 주는가?
  • RQ3데이터 구성, 긴 컨텍스트 학습, RL-정렬 전략이 오픈 소스 코드 모델의 성능에 어떤 영향을 미치는가?
  • RQ4오픈 소스 모델이 코드와 수학 과제에 특화되더라도 일반 언어 능력을 어느 정도 유지할 수 있는가?

주요 결과

  • DeepSeek-Coder-V2 (236B)가 코드 및 수학 벤치마크에서 GPT-4-Turbo, Claude 3 Opus, Gemini 1.5 Pro에 상응하거나 그 이상을 달성.
  • 코드 벤치마크는 236B 모델에서 HumanEval 90.2%, MBPP 76.2%(EvalPlus 파이프라인)이며 LiveCodeBench에서 43.4%.
  • 수학 과제에서 DeepSeek-Coder-V2는 MATH에서 75.7%에 도달하여 GPT-4o와 거의 일치하고 AIME 2024 및 관련 데이터 세트에서 다수의 비공개 모델보다 우수하다.
  • 이 모델은 338개의 프로그래밍 언어와 최대 128K 토큰의 컨텍스트 길이를 지원하며, 이전 연구의 86개 언어 및 16K 컨텍스트에서 확장되었다.
  • 오픈 소스 DeepSeek-Coder-V2-Instruct는 HumanEval/MBPP의 결합 언어에서 평균 75.3%를 달성하여 제시된 벤치마크 세트에서 GPT-4o에 이어 두 번째로 높다.
  • 장기 컨텍스트 및 FIM 활성화 변형(16B)은 강력한 코드 완성 및 수리 능력을 보여주며, FIM 작업 및 수리 벤치마크에서 두드러진 결과를 보인다.
Figure 2: Evaluation results on the “Needle In A Haystack” (NIAH) tests. DeepSeek-Coder-V2 performs well across all context window lengths up to 128K.
Figure 2: Evaluation results on the “Needle In A Haystack” (NIAH) tests. DeepSeek-Coder-V2 performs well across all context window lengths up to 128K.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.