Skip to main content
QUICK REVIEW

[논문 리뷰] BigTranslate: Augmenting Large Language Models with Multilingual Translation Capability over 100 Languages

Wen Yang, Chong Li|arXiv (Cornell University)|2023. 05. 29.
Natural Language Processing Techniques인용 수 6
한 줄 요약

BigTranslate는 세 단계 훈련을 통해 102개 언어에서 다국어 번역 기능을 LLaMA-13B 언어 모델에 통합한다: 중국어 단일 언어 데이터에서의 계속 학습, 대규모 다국어 병렬 코퍼스에서의 계속 학습, 다국어 번역 지시문을 통한 지시 튜닝. 모델은 GPT-4 평가 기준으로 Google Translate와 유사한 성능을 보이며, ChatGPT를 8개 언어 쌍에서 능가한다.

ABSTRACT

Large language models (LLMs) demonstrate promising translation performance among various natural languages. However, many LLMs especially the open-sourced ones, such as BLOOM and LLaMA, are English-dominant and support only dozens of natural languages, making the potential of LLMs on language translation less explored. In this work, we present BigTranslate which adapts LLaMA that covers only 20 languages and enhances it with multilingual translation capability on more than 100 languages. BigTranslate is built upon LLaMA-13B and it is optimized in three steps. First, we continue training LLaMA with massive Chinese monolingual data. Second, we continue training the model with a large-scale parallel dataset that covers 102 natural languages. Third, we instruct-tune the foundation model with multilingual translation instructions, leading to our BigTranslate model. The preliminary experiments on multilingual translation show that BigTranslate performs comparably with ChatGPT and Google Translate in many languages and even outperforms ChatGPT in 8 language pairs. We release the BigTranslate model and hope it can advance the research progress.

연구 동기 및 목표

  • 원래 20개 언어만 지원하는 영어 중심의 LLM인 LLaMA의 다국어 번역 능력을 확장하기 위해.
  • 한 개의 LLM이 100개 이상의 자연어, 특히 자원이 적은 언어를 포함해 고품질 번역을 수행할 수 있도록 하기 위해.
  • 단일 언어, 양면 텍스트, 지시 튜닝을 조합한 세 단계 훈련 과정을 통해 번역 품질을 향상시키기 위해.
  • 자동 평가 지표와 GPT-4를 인간과 유사한 평가자로 사용하여, Google Translate 및 ChatGPT와 같은 최첨단 시스템과의 성능 비교를 수행하기 위해.

제안 방법

  • 중국어 단일 언어 텍스트의 대규모 데이터에서 LLaMA-13B를 계속 학습하여 중국어 언어 이해 능력을 강화하기 위해.
  • 102개 자연어를 포함하는 대규모 병렬 데이터셋에서 커리큘럼 학습 전략을 사용하여 다국어 일반화 능력을 향상시키기 위해 계속 학습을 추가로 수행하기 위해.
  • 다양한 다국어 번역 지시문을 통한 지시 튜닝을 통해 모델을 제로샷 번역 작업에 맞추고 제로샷 일반화 능력을 향상시키기 위해.
  • GPT-4를 인간과 유사한 평가자로 사용하여 프롬프트 기반 점수 체계(0–5점)를 통해 번역의 의미 유사성과 스타일 일관성 평가하기 위해.
  • 70개 언어 쌍과 표준화된 프롬프트를 사용한 균형 잡힌 평가 설정을 통해 다양한 모델 간 신뢰성 있는 비교 확보하기 위해.
  • GitHub를 통한 모델 배포를 통해 개방형 연구와 커뮤니티 도입을 촉진하기 위해.

실험 결과

연구 질문

  • RQ1원래 20개 언어로 제한된 대규모 언어 모델이 100개 이상의 언어에서 효과적으로 번역 기능을 확장할 수 있는가?
  • RQ2다양한 언어 쌍에서, 튜닝된 LLM 기반 번역기의 성능은 Google Translate 및 ChatGPT와 같은 상용 시스템과 비교해 어떻게 되는가?
  • RQ3지시 튜닝이 자원이 적은 환경에서 제로샷 다국어 번역 능력을 얼마나 향상시킬 수 있는가?
  • RQ4양면 텍스트를 사용한 다국어 사전 훈련이 고자원 언어에서 저자원 언어로 지식을 효과적으로 전이하는가?

주요 결과

  • GPT-4 평가 기준으로 BigTranslate는 다양한 언어에서 Google Translate 및 OpenAI의 ChatGPT와 유사한 번역 품질을 달성한다.
  • 70개 언어 쌍 중 28개(40%)에서 BigTranslate가 GPT-4 평가 점수 3.5 이상을 기록하여 양호하거나 우수한 번역 품질을 나타낸다.
  • GPT-4 평가 기준으로 BigTranslate가 8개 언어 쌍에서 ChatGPT를 능가하여 특정 다국어 시나리오에서 뛰어난 성능을 보인다.
  • 많은 언어 쌍에서 BigTranslate와 Google Translate 간의 성능 격차가 크게 좁혀져 강력한 경쟁 성능을 보이고 있다.
  • 티베트어 및 몽골어와 같은 저자원 언어에서도 BigTranslate가 뛰어난 능력을 보이며, 고자원 언어에서의 지식 전이 효과가 뛰어나다는 것을 시사한다.
  • 단일 언어, 양면 텍스트, 지시 튜닝의 세 단계 훈련 파이프라인은 원래 LLaMA 모델을 초월한 다국어 번역 능력을 효과적으로 확장하는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.