Skip to main content
QUICK REVIEW

[논문 리뷰] Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language Models

Chaoqun Liu, Wenxuan Zhang|arXiv (Cornell University)|2024. 03. 15.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 연구는 다국어 쿼리를 영어로 번역하는 것이 대규모 언어 모델(Large Language Models, LLMs)에 최적인지 조사한다. 영어 중심의 LLM에서 비영어 NLP 작업에 대해 번역이 성능을 향상시키지만, 문화적으로 민감한 작업에서는 원어로 프롬프팅이 번역을 능가함을 발견한다. 주요 기여는 영어 중심의 번역을 보편적 해결책으로 삼는 대신, 모든 언어에서 동등한 숙련도를 갖춘 다국어 LLM 개발을 주장하는 데 있다.

ABSTRACT

Large language models (LLMs) have demonstrated multilingual capabilities, yet they are mostly English-centric due to the imbalanced training corpora. While prior works have leveraged this bias to enhance multilingual performance through translation, they have been largely limited to natural language processing (NLP) tasks. In this work, we extend the evaluation to real-world user queries and non-English-centric LLMs, offering a broader examination of multilingual performance. Our key contribution lies in demonstrating that while translation into English can boost the performance of English-centric LLMs on NLP tasks, it is not universally optimal. For culture-related tasks that need deep language understanding, prompting in the native language proves more effective as it better captures the nuances of culture and language. Our experiments expose varied behaviors across LLMs and tasks in the multilingual context, underscoring the need for a more comprehensive approach to multilingual evaluation. Therefore, we call for greater efforts in developing and evaluating LLMs that go beyond English-centric paradigms.

연구 동기 및 목표

  • 다양한 언어에서 LLM 성능 향상을 위해 다국어 쿼리를 영어로 번역하는 것이 효과적인지 평가하기.
  • 실세계 및 NLP 벤치마크 시나리오에서 번역 기반 프롬프팅과 원어 프롬프팅, 다국어 프롬프팅 전략을 비교하기.
  • 영어 중심 LLM이 번역으로부터 유익을 얻는지 여부 또는 문화적으로 뉘앙스가 중요한 작업에서 원어 프롬프팅이 더 뛰어난 결과를 낼 수 있는지 조사하기.
  • 비영어 언어에 최적화된 다국어 LLM의 성능을 평가하여, 깊은 문화 이해가 요구되는 작업에서의 성능을 분석하기.
  • 영어 중심 모델의 한계를 보완하기 위해 영어 번역을 보편적 해결책으로 삼는 대신, 모든 언어에서 균형 잡힌 능력을 갖춘 진정으로 다국어 LLM 개발을 주장하기.

제안 방법

  • Llama-2, Mistral, Llama-70B, ChatGPT 등의 다국어 LLM과 Google Translate, NLLB, XLT 등의 번역 도구를 사용하여 프롬프팅 전략을 비교하기 위한 통제 실험을 다수 수행하기.
  • 프롬프팅 전략 평가: 원어 기본형, 원어 CoT(사고 체인), 영어 기본형, 영어 CoT, XLT(다국어 전이), Google/NLLB를 통한 번역.
  • 표준화된 벤치마크 사용: NLP 작업을 위한 MKQA(다국어 질의 응답), M3Exam(다국어 추론), XL-sum(다국어 요약).
  • ShareGPT에서 수집한 실세계 다국어 사용자 쿼리를 사용하여 개방형 비정형 상황에서의 실용적 성능 평가하기.
  • 일致성과 신뢰성을 확보하기 위해 GPT-4-Turbo를 심사 모델로 활용하여 LLM-as-a-judge 프롬프트를 사용해 응답 품질 평가하기.
  • 현지 문화 지식이 필요한지 여부를 탐지하기 위한 프롬프트를 설계하여, 문화적으로 민감한 작업에 대한 대상 분석 가능하게 하기.

실험 결과

연구 질문

  • RQ1영어 중심 LLM에서 다양한 NLP 작업에 대해 다국어 쿼리를 영어로 번역하는 것이 일관되게 성능 향상에 기여하는가?
  • RQ2실세계 다국어 사용자 쿼리에서 원어 프롬프팅은 번역 기반 프롬프팅과 비교해 어떻게 성능을 냈는가?
  • RQ3어떤 조건에서 번역이 성능을 떨어뜨리며, 특히 문화적 또는 언어적 뉘앙스가 요구되는 작업에서 어떻게 영향을 미치는가?
  • RQ4비영어 언어에 최적화된 다국어 LLM이 원어로 프롬프팅되었을 때 영어 중심 모델을 능가할 수 있는가?
  • RQ5다국어 성능을 확보하기 위해 번역이 충분하거나 최적의 전략인지 여부, 아니면 진정으로 다국어 모델이 필요한가?

주요 결과

  • 자원이 적은 언어에서는 영어로의 번역이 성능 향상에 상당한 기여를 하며, Llama-2-70B-Chat에서 터키어 언어로 Trans-Google를 사용할 경우 MKQA에서 F1 점수가 47.9에 도달함.
  • 문화 관련 작업에서는 원어 프롬프팅이 더 뛰어난 결과를 낸다. 예를 들어, Llama-2-70B-Chat은 중국어에 대해 원어 프롬프팅을 사용하여 XL-sum에서 ROUGE-1 점수 39.7을 기록했으며, 번역 기반 방법보다 뛰어남.
  • 자원이 풍부한 언어인 중국어와 프랑스어에서는 CoT(사고 체인)를 사용한 원어 프롬프팅이 일관되게 번역을 능가했으며, Llama-2-70B-Chat은 프랑스어에 대해 원어 CoT을 사용할 경우 ROUGE-1 점수 34.5를 기록함.
  • 번역 기반 프롬프팅(예: Trans-Google)은 언어에 관계없는 작업(예: MGSM 수학)에서는 성능 향상을 보였지만, 현지적 맥락이 필요한 중국어 질문과 같은 문화적으로 의존적인 작업에서는 성능 저하를 보였음.
  • 비영어 언어에 최적화된 다국어 LLM은 원어 성능이 뛰어나며, 이는 언어별 피팅 튜닝이 문화적 뉘앙스 이해를 향상시킨다는 것을 시사함.
  • 연구는 번역이 항상 최적은 아니며, 영어 중심 모델의 한계를 극복하기 위해 진정으로 다국어 LLM 개발이 필수적이라고 결론 내림.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.