[논문 리뷰] Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone
Phi-3-mini는 3.8B 파라미터 언어 모델로 3.3T 토큰에서 학습되었으며 휴대폰에서 실행 가능하고 Mixtral 8x7B 및 GPT-3.5와 같은 대형 모델과 대등하거나 경쟁하며, 추가 변형(7B 및 14B)이 더 강력한 성능을 보여준다; 성능은 필터링된 웹 데이터와 합성 데이터를 결합한 데이터 중심 학습 레시피와 안전성 및 채팅에 대한 정렬(safety alignment)에서 비롯된다.
We introduce phi-3-mini, a 3.8 billion parameter language model trained on 3.3 trillion tokens, whose overall performance, as measured by both academic benchmarks and internal testing, rivals that of models such as Mixtral 8x7B and GPT-3.5 (e.g., phi-3-mini achieves 69% on MMLU and 8.38 on MT-bench), despite being small enough to be deployed on a phone. Our training dataset is a scaled-up version of the one used for phi-2, composed of heavily filtered publicly available web data and synthetic data. The model is also further aligned for robustness, safety, and chat format. We also provide parameter-scaling results with a 7B, 14B models trained for 4.8T tokens, called phi-3-small, phi-3-medium, both significantly more capable than phi-3-mini (e.g., respectively 75%, 78% on MMLU, and 8.7, 8.9 on MT-bench). To enhance multilingual, multimodal, and long-context capabilities, we introduce three models in the phi-3.5 series: phi-3.5-mini, phi-3.5-MoE, and phi-3.5-Vision. The phi-3.5-MoE, a 16 x 3.8B MoE model with 6.6 billion active parameters, achieves superior performance in language reasoning, math, and code tasks compared to other open-source models of similar scale, such as Llama 3.1 and the Mixtral series, and on par with Gemini-1.5-Flash and GPT-4o-mini. Meanwhile, phi-3.5-Vision, a 4.2 billion parameter model derived from phi-3.5-mini, excels in reasoning tasks and is adept at handling both single-image and text prompts, as well as multi-image and text prompts.
연구 동기 및 목표
- 작은 언어 모델도 모델 크기 확장만으로가 아니라 데이터 품질과 표적 후학습으로 높은 성능을 달성할 수 있음을 입증한다.
- phi-3-mini가 디바이스에서(r context 4K; 128K 롱 컨텍스트 변형) 작동하고 4비트 양자화로 약 1.8GB에 맞출 수 있음을 보여준다.
- phi-3-small 및 phi-3-medium을 더 높은 용량 변형으로 소개하고 이들의 성능을 더 큰 베이스라인과 비교한다.
- 데이터셋 설계, 2단계 프리훈련, 포스트트레이닝(SFT 및 DPO) 및 안전성 정렬 프로세스를 설명한다.
제안 방법
- 컨버터 디코더를 사용하는 트랜스포머로 3072 은닉 차원, 32 헤드, 32 층; 4K 컨텍스트(롱로프(LongRope)로 128K 변형).
- 3.3T 토큰에서 heavily filtered web data와 합성 데이터를 사용해 두 단계로 학습(Phase-1 일반 지식, Phase-2 추론/니치 기술).
- 안전성, 견고성, 채팅 스타일 사용에 맞춰 감독학습 미세조정(SFT) 및 직접 선호도 최적화(DPO)로 포스트-트레이닝 수행.
- phi-3-mini를 4비트로 양자화해 약 1.8GB의 디바이스 배포를 달성하고, 표준 벤치마크에서 5샷 이하 프롬프트와 고정 평가 파이프라인으로 평가한다.

실험 결과
연구 질문
- RQ1작은 언어 모델(4B 미만)이 데이터 최적화 룰과 포스트-트레이닝 정렬로 더 큰 모델의 성능에 도달할 수 있는가?
- RQ2모델 크기, 데이터 질, 컨텍스트 길이 간의 트레이드오프가 디바이스 상 LLM 배치에 어떻게 작용하는가?
- RQ3데이터 선별과 SFT 및 DPO가 소형 LLM의 안전성, 견고성, 지시 준수에 어떤 영향을 주는가?
- RQ4롱 컨텍스트 확장(128K)이 표준 4K 컨텍스트에 비해 답변 품질에 어떤 영향을 미치는가?
주요 결과
- phi-3-mini (3.8B)가 MMLU에서 69% 및 8.38 MT-bench를 달성하며 Mixtral 8x7B 및 GPT-3.5와 경쟁한다.
- phi-3-small (7B, 프리뷰)가 MMLU에서 75% 및 8.7 MT-bench를 달성한다.
- phi-3-medium (14B, 프리뷰)가 MMLU에서 78% 및 8.9 MT-bench를 달성한다.
- 롱-context phi-3-mini-128K가 4K와 유사한 품질을 유지하면서 롱-컨텍스트 작업을 처리한다.
- 4비트 양자화된 phi-3-mini가 iPhone 14의 A16 Bionic에서 초당 12+ 토큰으로 실행된다.
- SFT 및 DPO 포스트-트레이닝이 유해한 응답을 줄이고 안전성, 견고성 및 추론 능력을 향상시킨다.
- 데이터 최적화 규범을 사용해 소형 모델의 학습 데이터를 보정함으로써 데이터 품질이 성능에서 일정 부분 규모의 대체 효과를 낼 수 있음을 보인다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.