[논문 리뷰] InternLM2 Technical Report
InternLM2는 30개 벤치마크에서 이전 오픈 모델을 능가하는 오픈 소스 LLM이며, 최대 200k까지의 긴 컨텍스트를 지원하고, COOL RLHF를 이용한 정렬을 사용합니다.
The evolution of Large Language Models (LLMs) like ChatGPT and GPT-4 has sparked discussions on the advent of Artificial General Intelligence (AGI). However, replicating such advancements in open-source models has been challenging. This paper introduces InternLM2, an open-source LLM that outperforms its predecessors in comprehensive evaluations across 6 dimensions and 30 benchmarks, long-context modeling, and open-ended subjective evaluations through innovative pre-training and optimization techniques. The pre-training process of InternLM2 is meticulously detailed, highlighting the preparation of diverse data types including text, code, and long-context data. InternLM2 efficiently captures long-term dependencies, initially trained on 4k tokens before advancing to 32k tokens in pre-training and fine-tuning stages, exhibiting remarkable performance on the 200k ``Needle-in-a-Haystack" test. InternLM2 is further aligned using Supervised Fine-Tuning (SFT) and a novel Conditional Online Reinforcement Learning from Human Feedback (COOL RLHF) strategy that addresses conflicting human preferences and reward hacking. By releasing InternLM2 models in different training stages and model sizes, we provide the community with insights into the model's evolution.
연구 동기 및 목표
- 오픈 소스 LLM의 다중 벤치마크 및 차원에 걸친 성능 시연.
- 텍스트, 코드, 장문 컨텍스트 데이터를 포함한 다양한 사전 학습 데이터 준비를 상세화.
- 32k+ 컨텍스트 윈도우 및 200k needle-in-a-haystack 기능을 가능하게 하는 긴 컨텍스트 학습 기법 설명.
- 대립적인 인간 선호를 다루기 위한 SFT 및 COOL RLHF를 포함한 정렬 방법 설명.
- 커뮤니티 채택을 안내하기 위한 인프라(IneternEvo)와 단계별 모델 진화 소개
제안 방법
- 텍스트 데이터의 포맷, 중복 제거, 안전성 및 품질 필터링을 포함한 데이터 처리 파이프라인 설명.
- Chinese 증강이 포함된 GPT-4 스타일 cl100k 어휘 기반 사전 학습 토크나이제이션 설명.
- 4k 컨텍스트 데이터에서 32k 컨텍스트 데이터로의 긴 컨텍스트 사전 학습 및 중복 제거를 위한 Locality-Sensitive Hashing 개요.
- Long-context 추론을 위한 Grouped-Query Attention (GQA) 및 텐서-병렬 레이아웃 선택에 대해 설명.
- 상호 구속된 보상 모델과 PPO 업데이트를 포함한 조건부 Online RLHF(COOL RLHF) 및 SFT의 상세 구성.
- 메모리 효율성, 장애 허용성, 인터랙티브 RLHF 설정을 갖춘 InternEvo 학습 프레임워크 제시
실험 결과
연구 질문
- RQ1InternLM2가 6개 차원과 30개 벤치마크에서 오픈 소스 경쟁자 대비 어떤 성능을 보이는가?
- RQ2안전하고 고품질의 사전 학습 데이터를 지원하는 데이터 처리 및 필터링 전략은 무엇인가?
- RQ3장문 컨텍스트 모델(최대 200k 토큰)을 실제로 효과적으로 학습하고 활용할 수 있는가?
- RQ4COOL RLHF가 인간의 선호 충돌과 보상 해킹 문제를 정렬에서 어떻게 해결하는가?
- RQ5커뮤니티의 확장성과 재현성을 높이는 인프라 및 모델 진화 관행은 무엇인가?
주요 결과
- InternLM2가 포괄적 평가와 긴 컨텍스트 작업에서 이전 오픈 소스 모델을 능가한다.
- 모델은 200k 컨텍스트 테스트에서 거의 완전한 needle 탐지까지의 긴 컨텍스트 성능을 달성한다.
- COOL RLHF는 다양한 선호를 조정하고 보상 해킹을 완화함으로써 주관적 정렬 결과를 향상시킨다.
- 높은 품질의 안전 필터링된 사전 학습 데이터가 안정성과 성능에 결정적이다.
- InternEvo는 수천 대의 GPU에 걸친 확장 가능하고 장애 허용적인 학습 및 상호 RLHF를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.