Skip to main content
QUICK REVIEW

[논문 리뷰] Don't Trust ChatGPT when Your Question is not in English: A Study of Multilingual Abilities and Types of LLMs

Xiang Zhang, Senyu Li|arXiv (Cornell University)|2023. 05. 24.
Topic Modeling인용 수 5
한 줄 요약

이 연구는 대규모 언어 모델(Large Language Models, LLMs)의 다국어 능력을 체계적으로 평가하기 위한 새로운 프레임워크를 제안한다. 분석 결과, GPT-3.5와 같은 모델들은 영어를 본질적인 언어로 삼아 추론하는 경향을 보이며, 이는 영어 외 언어 입력에서 성능 저하를 초래한다. 특히 번역 변형 작업에서 두드러진다. 저자들은 언어 의존적 성능을 평가하기 위해 응답 역번역(Response Back-Translation, RBT)을 제안하였으며, 세 가지 작업 유형을 식별한다: 추론, 지식 접근, 언어 표현.

ABSTRACT

Large Language Models (LLMs) have demonstrated exceptional natural language understanding abilities and have excelled in a variety of natural language processing (NLP)tasks in recent years. Despite the fact that most LLMs are trained predominantly in English, multiple studies have demonstrated their comparative performance in many other languages. However, fundamental questions persist regarding how LLMs acquire their multi-lingual abilities and how performance varies across different languages. These inquiries are crucial for the study of LLMs since users and researchers often come from diverse language backgrounds, potentially influencing their utilization and interpretation of LLMs' results. In this work, we propose a systematic way of qualifying the performance disparities of LLMs under multilingual settings. We investigate the phenomenon of across-language generalizations in LLMs, wherein insufficient multi-lingual training data leads to advanced multi-lingual capabilities. To accomplish this, we employ a novel back-translation-based prompting method. The results show that GPT exhibits highly translating-like behaviour in multilingual settings.

연구 동기 및 목표

  • 대규모 언어 모델(LLMs)의 다국어 능력을 체계적으로 분석하고, 언어 선택이 성능에 미치는 영향을 집중적으로 연구한다.
  • 주로 영어 데이터로 훈련된 LLMs에서의 다국어 일반화 메커니즘을 탐구한다.
  • 입력 언어에 대한 민감도에 따라 세 가지 유형—추론, 지식 접근, 언어 표현—으로 언어 의존적 작업을 분류한다.
  • 새로운 프롬프팅 기법을 사용하여 LLMs가 복합, 공통, 또는 열등 다국어 능력을 보이는지 평가한다.
  • 특히 비영어 입력에서의 성능 저하를 규명하고, 번역 변형 작업에서의 현재 LLMs의 한계를 특정한다.

제안 방법

  • 응답 역번역(Response Back-Translation, RBT)이라고 불리는 새로운 프롬프팅 기법을 제안한다. 이는 모델의 출력을 원래 입력 언어로 다시 번역하여 일관성과 정확도를 평가한다.
  • NLP 작업을 세 가지 유형으로 분류한다: 추론(가장 낮은 언어 민감도), 지식 접근(중간 민감도), 언어 표현(가장 높은 민감도).
  • 비교 평가 프레임워크를 적용한다: 다국어로 입력 작업을 제공하고, 모델의 응답을 생성한 후 원래 언어로 역번역하여 비교한다.
  • 인간 평가를 통해 영어, 스페인어, 중국어에서의 모델 출력 정확도와 언어 일관성을 검증한다.
  • GPT-3.5와 Llama2를 평가하기 위해 이 프레임워크를 적용하여 농담 탐지, 번역, 사실 지식 작업에서 비영어 환경에서의 성능 저하를 규명한다.
  • 이중어의 언어 유형(복합, 공통, 열등) 분석을 통해 LLM의 행동과 내부 표현을 해석한다.

실험 결과

연구 질문

  • RQ1GPT-3.5와 같은 LLMs가 입력 언어가 영어가 아닐 경우 다국어로 얼마나 잘 일반화하는가?
  • RQ2LLMs의 성능은 추론, 지식 접근, 언어 표현 유형의 언어 의존적 작업에서 어떻게 달라지는가?
  • RQ3응답 패턴과 역번역 일관성에 기반해 LLMs가 복합, 공통, 또는 열등 다국어 능력을 보이는가?
  • RQ4입력 언어가 비영어일 경우, 번역 변형 작업에서 LLMs가 번역 등가 작업보다 성능이 열 劣하는 이유는 무엇인가?
  • RQ5이중어의 언어 유형론을 활용하여 LLM의 다국어 행동을 체계적으로 분류하고 평가할 수 있는가?

주요 결과

  • GPT-3.5는 입력 언어가 영어인지 여부에 관계없이 번역 등가 작업(예: 사실 지식, 추론)에서 뛰어난 성능을 보이며, 강력한 다국어 일반화 능력을 나타낸다.
  • 입력 언어가 영어가 아닐 경우, 번역 변형 작업(예: 농담 탐지, 언어 특화 표현)에서 성능 저하가 심각하게 발생하여 언어 의존적 한계를 드러낸다.
  • 모델는 영어를 본질적인 언어로 삼아 추론 및 출력 생성을 수행하는 명백한 열등 다국어 능력을 보이며, 다른 언어로 프롬프트가 들어오더라도 마찬가지다.
  • 응답 역번역(RBT)은 비영어 입력에서 특히 성능 불일치와 언어적 이탈을 효과적으로 식별하여 진단 도구로의 유용성을 입증한다.
  • Llama2는 심각한 한계를 보였다: 자주 응답을 거부하고, 영어로 전환하며, 비영어 환경에서 낮은 내용의 또는 비논리적인 출력을 생성한다.
  • 이 연구는 현재 LLMs가 진정으로 복합 다국어 모델이 아니며, 훈련 데이터의 불균형과 병렬 코퍼스 부족으로 인해 언어 간 공통의 보편적 표현이 형성되지 못하고 있음을 결론 내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.