[논문 리뷰] Sabiá-2: A New Generation of Portuguese Large Language Models
Sabiá-2는 브라질리언 학술 및 전문 분야에 특화된 신세대 포르투갈어 대규모 언어 모델이다. Sabiá-2 Medium는 64개 시험 중 58개에서 GPT-3.5를 능가하고, 64개 중 23개에서 GPT-4와 동등하거나 이를 초월한다. 이는 토큰당 비용의 1/10로 운영되며, 모델 크기를 늘리지 않고도 도메인 특화를 통해 높은 성능을 달성한다. 이는 브라질리언 학술 및 전문 시험, 문화적으로 관련성 있는 다단계 대화에서 뛰어난 성과를 보여준다.
We introduce Sabiá-2, a family of large language models trained on Portuguese texts. The models are evaluated on a diverse range of exams, including entry-level tests for Brazilian universities, professional certification exams, and graduate-level exams for various disciplines such as accounting, economics, engineering, law and medicine. Our results reveal that our best model so far, Sabiá-2 Medium, matches or surpasses GPT-4's performance in 23 out of 64 exams and outperforms GPT-3.5 in 58 out of 64 exams. Notably, specialization has a significant impact on a model's performance without the need to increase its size, allowing us to offer Sabiá-2 Medium at a price per token that is 10 times cheaper than GPT-4. Finally, we identified that math and coding are key abilities that need improvement.
연구 동기 및 목표
- 브라질리언 학술 및 전문 분야에 특화된 신세대 포르투갈어 대규모 언어 모델을 개발하기 위해.
- 피팅 트레이닝 없이도 다양한 고위험도 브라질리언 시험에서 모델 성능을 평가하여 사전 훈련된 능력만을 사용하기 위해.
- 모델 크기를 늘리지 않고도 특화가 성능 향상과 비용 절감에 기여함을 입증하기 위해.
- 브라질리언 맥락에서 문화적으로 관련성 있는 다단계 대화를 다룰 수 있는 능력을 평가하기 위해.
- 특히 수학 및 프로그래밍 분야에서의 주요 한계를 특정하여 향후 개선을 위한 기반을 마련하기 위해.
제안 방법
- 공개되지 않은 아키텍처 및 훈련 방법을 사용하여 포르투갈어 텍스트 전용으로 대규모 언어 모델(Sabiá-2)을 훈련하기 위해.
- 브라질리언 학술 및 전문 시험의 다중 선택형 문제집을 대상으로 모델 평가를 수행하며, ENEM, BLUEX, ENADE, POSCOMP 등을 포함한다.
- BRACEval 벤치마크에서 다단계 대화 품질을 평가하기 위해 GPT-4를 심판으로 사용하며, 위치 편향을 줄이기 위해 프롬프트 순서를 뒤집었다.
- 법률, 의학, 공학, 경제학, 교육 등 다양한 분야에서의 정확도를 측정하기 위해 도메인별 성능 평가를 수행하기 위해.
- 모델 크기를 늘리지 않고도 도메인 특화를 통해 성능 향상을 이끌어내고 비용 효율성을 확보하기 위해.
- 표준화되고 전문가가 제작한 시험을 사용하여 공정성과 관련성을 확보하고 비전문가 평가에서 발생할 수 있는 편향을 최소화하기 위해.

실험 결과
연구 질문
- RQ1특화된 포르투갈어 LLM이 피팅 트레이닝 없이도 일반 목적 모델인 GPT-3.5나 GPT-4보다 브라질리언 학술 및 전문 시험에서 뛰어난 성능을 보일 수 있는가?
- RQ2모델 크기나 추론 비용을 늘리지 않고도 도메인 특화가 얼마나 성능 향상에 기여하는가?
- RQ3Sabiá-2는 주요 기업 모델들과 비교해 문화적으로 관련성 있는 다단계 대화에서 어떤 성과를 내는가?
- RQ4모델의 주요 한계, 특히 수학 및 프로그래밍 분야에서의 문제점은 무엇이며, 최신 기술 수준의 모델과 비교해 어떻게 나타나는가?
- RQ5GPT-4와 같은 AI 심판이 문화적으로 뉘앙스가 있는 개방형 과제에서 모델의 응답을 신뢰성 있고 일관성 있게 평가할 수 있는가?
주요 결과
- Sabiá-2 Medium는 64개 시험 중 58개에서 GPT-3.5 Turbo를 능가하여 다양한 분야에서 뛰어난 일반화 능력을 보였다.
- Sabiá-2 Medium는 64개 시험 중 23개에서 GPT-4의 성능과 동등하거나 이를 초월했으며, 특히 법학, 의학, 교육 분야에서 두드러진 성과를 보였다.
- 벤치마크 전체에서 GPT-3.5 Turbo 및 Gemini 1.0 Pro와의 성능 일치율 또는 초월율이 96.9%에 이르렀다.
- Sabiá-2 Medium는 토큰당 비용이 8배 낮음에도 불구하고, Mistral Large보다 76.6%의 시험에서 승리했다.
- BRACEval에서의 다단계 대화 평가에서, 유해 콘텐츠 응답에 대해 100%에서 승리했지만, Claude 3 Sonnet 및 GPT-3.5 Turbo와 비교해 코딩 질문에선 단지 15%에서 승리했다.
- 수학 및 프로그래밍 분야에서 뚜렷한 도전 과제를 보이며 향후 개선이 필요한 핵심 분야로 지목되었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.