Skip to main content
QUICK REVIEW

[논문 리뷰] Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback

Viet Dac Lai, Chien Van Nguyen|arXiv (Cornell University)|2023. 07. 29.
Topic ModelingComputer Science인용 수 3
한 줄 요약

Okapi는 26개의 언어에서 다국어 대규모 언어 모델(Large Language Models, LLMs)을 위한 첫 번째 지시 조정 지능형 강화학습(Reinforcement Learning from Human Feedback, RLHF) 기반 프레임워크를 소개한다. 이 프레임워크는 지시 및 응답 순서가 매겨진 데이터셋, 벤치마크 평가를 제공하며, 특히 자원이 부족한 언어에서 RLHF가 지도 미세조정(Supervised Fine-Tuning, SFT)보다 유의미하게 뛰어난 성능을 보임을 입증한다.

ABSTRACT

A key technology for the development of large language models (LLMs) involves instruction tuning that helps align the models' responses with human expectations to realize impressive learning abilities. Two major approaches for instruction tuning characterize supervised fine-tuning (SFT) and reinforcement learning from human feedback (RLHF), which are currently applied to produce the best commercial LLMs (e.g., ChatGPT). To improve the accessibility of LLMs for research and development efforts, various instruction-tuned open-source LLMs have also been introduced recently, e.g., Alpaca, Vicuna, to name a few. However, existing open-source LLMs have only been instruction-tuned for English and a few popular languages, thus hindering their impacts and accessibility to many other languages in the world. Among a few very recent work to explore instruction tuning for LLMs in multiple languages, SFT has been used as the only approach to instruction-tune LLMs for multiple languages. This has left a significant gap for fine-tuned LLMs based on RLHF in diverse languages and raised important questions on how RLHF can boost the performance of multilingual instruction tuning. To overcome this issue, we present Okapi, the first system with instruction-tuned LLMs based on RLHF for multiple languages. Okapi introduces instruction and response-ranked data in 26 diverse languages to facilitate the experiments and development of future multilingual LLM research. We also present benchmark datasets to enable the evaluation of generative LLMs in multiple languages. Our experiments demonstrate the advantages of RLHF for multilingual instruction over SFT for different base models and datasets. Our framework and resources are released at https://github.com/nlp-uoregon/Okapi.

연구 동기 및 목표

  • 비영어 언어에서 인간 피드백을 통한 강화학습(RLHF)으로 훈련된 다국어 지시 조정 LLM의 부족함을 해결한다. 이는 아직 영어 외 언어에서 탐색되지 않은 분야이다.
  • 영어와 몇몇 주요 언어 외의 다국어 생성형 LLM을 위한 훈련 및 평가 데이터의 부족함을 해결한다.
  • 다양한 언어를 위한 오픈소스 모델, 데이터셋, 벤치마크를 공개하여 고성능 지시 일치 LLM에 대한 접근성을 넓힌다.
  • 여러 기본 모델과 언어에서 다국어 지시 조정에서 RLHF와 지도 미세조정(SFT)의 효과를 평가한다.
  • 자원이 부족하거나 대표성이 떨어지는 언어를 위한 표준화된 벤치마크와 훈련 자원을 제공함으로써 향후 다국어 생성 AI 연구를 지원한다.

제안 방법

  • 지시, 입력, 원하는 응답의 삼중조를 포함한 26개의 다양한 언어에서 지시 수행 데이터를 수집하고 정제한다.
  • LLM(예: ChatGPT)을 사용하여 비교적 출력을 생성함으로써 응답 순서가 매겨진 데이터를 생성하여 RLHF의 보상 모델링에 활용한다.
  • 순서가 매겨진 응답에 기반해 보상 모델을 훈련시켜 인간의 선호도와 일치하는 밀도 높은 보상 신호를 제공한다.
  • 보상 모델을 사용하여 기본 LLM(BLOOM 및 LLaMA-7B)을 강화학습 기반으로 미세조정함으로써 인간 선호도와의 일치도를 최적화한다.
  • 영어에서의 제로샷 평가를 위해 HuggingFace Open LLM 리더보드의 벤치마크(ARC, HellaSwag, MMLU, TruthfulQA)를 활용하며, 이를 다국어 분석에 적합하게 변형한다.
  • 프레임워크 전체, 데이터셋, 훈련된 모델을 https://github.com/nlp-uoregon/Okapi 에 공개하여 개방형 연구와 재현 가능성을 지원한다.

실험 결과

연구 질문

  • RQ1RLHF는 다양한 언어에서 SFT에 비해 다국어 LLM의 지시 수행 성능을 유의미하게 향상시킬 수 있는가?
  • RQ2RLHF로 훈련된 지시 조정 LLM은 자원이 부족한 언어와 자원이 풍부한 언어 모두에 어떻게 일반화되는가?
  • RQ3MMLU 및 HellaSwag와 같은 다국어 벤치마크에서 RLHF 기반 모델이 SFT 기반 모델보다 얼마나 뛰어나게 성능을 내는가?
  • RQ4자동 생성 및 번역된 지시-응답 쌍은 다국어 RLHF 파이프라인 훈련에 얼마나 효과적인가?
  • RQ5특히 비영어 언어에서 RLHF와 SFT를 사용할 경우 다국어 지시 조정에서 성능 격차는 어느 정도인가?

주요 결과

  • 여러 기본 모델과 평가 벤치마크에서 RLHF 기반 지시 조정은 다국어 지시 조정에서 SFT를 뛰어넘는 유의미한 성능 향상을 보였다.
  • Okapi 프레임워크는 합성 데이터 생성을 사용하더라도 RLHF가 다국어 LLM의 일치도 및 추론 능력을 효과적으로 향상시킬 수 있음을 입증했다.
  • SFT가 제한된 감독 데이터로 어려움을 겪는 자원이 부족한 언어에서 RLHF의 성능 향상이 특히 두드러졌다.
  • 벤치마크 평가 결과, RLHF로 미세조정된 모델은 SFT 대비 MMLU, HellaSwag, TruthfulQA에서 더 높은 점수를 기록했다.
  • 26개 언어에서 공개된 지시 및 응답 순서가 매겨진 데이터셋은 향후 다국어 생성 AI 연구의 기초를 마련한다.
  • LLM에 의해 생성된 데이터에 의존함에도 불구하고, 프레임워크는 경쟁 가능한 성능을 달성하여 최소한의 인간 주석으로도 다국어 RLHF의 확장 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.