Skip to main content
QUICK REVIEW

[논문 리뷰] Phoenix: Democratizing ChatGPT across Languages

Zhihong Chen, Feng Jiang|arXiv (Cornell University)|2023. 04. 20.
Artificial Intelligence in Healthcare and Education인용 수 20
한 줄 요약

tldr: Phoenix는 BLOOMZ(Phoenix) 기반의 오픈 소스 다국어 LLM이며 Latin 버전 Chimera(LLaMA 백본)로, 많은 언어에 걸쳐 ChatGPT와 유사한 기능을 민주화하고, 비-라틴어 언어에서 강력한 성능을 달성하며 영어 모델과의 경쟁력 있는 결과를 보여줍니다.

ABSTRACT

This paper presents our efforts to democratize ChatGPT across language. We release a large language model "Phoenix", achieving competitive performance among open-source English and Chinese models while excelling in languages with limited resources (covering both Latin and non-Latin languages). We believe this work will be beneficial to make ChatGPT more accessible, especially in countries where people cannot use ChatGPT due to restrictions from OpenAI or local goverments. Our data, code, and models are available at https://github.com/FreedomIntelligence/LLMZoo.

연구 동기 및 목표

  • 다양한 언어에서 ChatGPT와 유사한 대화 모델을 구축하고 연구하는 진입 장벽을 낮춘다.
  • 지시 준수 데이터와 대화 데이터를 모두 활용하여 다국어 LLM을 훈련한다.
  • 언어 간 성능을 평가하고 기존의 오픈 소스 및 독점 모델과의 벤치마크를 설정한다.
  • 사전 학습 및 후학습 단계에서 다국어 데이터의 가치를 입증하여 언어별 편향을 줄인다.

제안 방법

  • Alpaca 파생 데이터, 번역 후 데이터, 사용자 중심 지시 데이터 세트를 40개 언어로 번역해 결합하여 다국어 지시 데이터를 구성한다.
  • ShareGPT과 Discord 채널에서 대화 데이터를 수집한 후 40개 언어로 번역하여 다국어 채팅 훈련을 지원한다.
  • 지시 준수 및 다중 턴 대화를 통합하여 BLOOMZ 기반 백본을 미세 조정해 Phoenix(다국어)와 Latin 체제 Chimera(LLaMA 백본)를 형성한다.
  • 최대 컨텍스트 길이 2048로 학습하고, AdamW를 사용하며 배치 크기 256, 3 에폭, 학습률 2e-5, 가중치 감소 없음.
  • 자동 평가(GPT-4 및 GPT-3.5 Turbo를 심사자로 사용)와 사람 평가를 중국어, 영어 및 다수의 비-라틴어를 포함한 언어들에 걸쳐 수행한다.
  • 오픈 소스 LLM(BELLE, Chinese-Alpaca, Vicuna 등)과 선택적 독점 모델(ChatGPT, Baidu-Wenxin)과 비교하여 Phoenix의 위치를 파악한다.
Phoenix: Democratizing ChatGPT across Languages

실험 결과

연구 질문

  • RQ1지시 준수 데이터와 대화 데이터를 모두 사용해 학습된 다국어 LLM이 여러 언어에서 기존의 오픈 소스 모델을 능가할 수 있는가?
  • RQ2다국어 과요가 비-라틴어 언어의 성능에 미치는 영향은 무엇이며, BLOOMZ 대 LLaMA 백본 선택으로 이를 완화할 수 있는가?
  • RQ3Latin 및 비-Latin 언어에서 Phoenix와 Chimera의 상대 성능은 최첨단 오픈 소스 및 독점 모델과 비교하여 어떤가?
  • RQ4지시 데이터와 대화 데이터를 결합하는 것이 각 데이터 유형만 사용할 때보다 측정 가능한 이점을 제공하는가?

주요 결과

  • Phoenix는 오픈 소스 중국어 LLM들 중 최첨단 성능을 달성하고 다수의 비-라틴어 모델들을 능가한다.
  • 비-라틴어 언어에서 Phoenix는 아랍어, 일본어, 한국어 벤치마크를 포함한 기존 오픈 소스 LLM들보다 대체로 우수하다.
  • Chimera (Latin Phoenix)는 GPT-4 유사 품질로 GPT-4 평가에서 96.6% ChatGPT 품질을 달성하여 새로운 오픈 소스 SOTA를 제시한다.
  • Phoenix는 중국어 및 영어 벤치마크에서 Baidu-Wenxin 및 BELLE과 강한 경쟁력을 보이나, 영어에서는 일부 비오픈 소스 모델이 더 높은 경우가 있다.
  • 변이 실험 결과 지시 데이터 추가가 대상 작업에서 Phoenix/Chimera에 상대적으로 약 5-6%의 개선을 보인다.
  • 인간 평가는 Phoenix가 다수의 확립된 오픈 소스 중국어 모델을 지배하거나 유사하게 나타나며 상용 모델과도 경쟁력을 유지함을 시사한다.
Figure 1 : Language Distribution in Our Dataset: Top 15 Languages Represented out of 133.
Figure 1 : Language Distribution in Our Dataset: Top 15 Languages Represented out of 133.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.