[논문 리뷰] ChatGPT MT: Competitive for High- (but not Low-) Resource Languages
이 연구는 FLORES-200 벤치마크를 사용하여 204개 언어에서 ChatGPT의 기계 번역(MT) 성능을 평가하며, NLLB, Google Translate, GPT-4와 비교한다. 분석 결과, 고자원 언어에서는 ChatGPT가 기존 MT 모델과 유사하거나 뛰어난 성능을 보였지만, 저자원 언어—특히 아프리카 언어—에서는 평가한 언어의 84.1%에서 뚜렷한 성능 열등성을 보였다.
Large language models (LLMs) implicitly learn to perform a range of language tasks, including machine translation (MT). Previous studies explore aspects of LLMs' MT capabilities. However, there exist a wide variety of languages for which recent LLM MT performance has never before been evaluated. Without published experimental evidence on the matter, it is difficult for speakers of the world's diverse languages to know how and whether they can use LLMs for their languages. We present the first experimental evidence for an expansive set of 204 languages, along with MT cost analysis, using the FLORES-200 benchmark. Trends reveal that GPT models approach or exceed traditional MT model performance for some high-resource languages (HRLs) but consistently lag for low-resource languages (LRLs), under-performing traditional MT for 84.1% of languages we covered. Our analysis reveals that a language's resource level is the most important feature in determining ChatGPT's relative ability to translate it, and suggests that ChatGPT is especially disadvantaged for LRLs and African languages.
연구 동기 및 목표
- 204개 언어(다수의 저자원 및 대표성이 부족한 언어 포함)를 포괄하는 광범위하고 다양한 언어 집합에서 ChatGPT의 기계 번역 능력을 평가하는 것.
- 특히 저자원 언어(LRLs) 사용자들이 기존 시스템과 비교해 ChatGPT를 신뢰할 만하게 번역에 활용할 수 있는지 여부를 확인하는 것.
- 언어 자원 수준, 언어학적 특성, 프롬프트 엔지니어링이 LLM 기반 MT 성능에 미치는 영향을 분석하는 것.
- ChatGPT, GPT-4, Google Translate, NLLB 등 여러 시스템 간 번역 비용을 비교하는 것.
- 저자원 환경에서 특히나 LLM을 번역에 어떻게, 언제 사용할 수 있는지에 대한 실질적 통찰을 사용자 및 연구자에게 제공하는 것.
제안 방법
- FLORES-200 벤치마크를 사용해 영어에서 목표 언어로의 번역을 위해 203개의 비영어 언어에 대해 1,012개의 개발 테스트 문장을 사용해 ChatGPT(gpt-3.5-turbo)를 평가한다.
- chrF++ 점수를 사용해 NLLB(최첨단 오픈소스 MT 모델), Google Translate(상업 시스템), GPT-4(20개 언어 서브셋에서만 평가)와의 성능을 비교한다.
- LLM 번역에 대한 문맥 예시의 영향을 평가하기 위해 zero-shot 및 five-shot 프롬프트를 테스트한다.
- ChatGPT의 MT 효과성과 가장 관련이 깊은 언어 특성(예: 자원 수준, 문자, 어족)을 특정하기 위해 의사결정트리 분석을 수행한다.
- OpenAI API 가격 체계를 기반으로 추정한 추론 비용을 사용해 ChatGPT를 다른 시스템과 비교함으로써 비용 분석을 수행한다.
- 번역 품질 예측 능력을 평가하기 위해 언어별 특성(자원 수준, 문자, 어족, 지리적 지역 등)을 활용한다.

실험 결과
연구 질문
- RQ1ChatGPT의 번역 성능은 고자원 및 저자원 언어를 포함한 다양한 언어에서 기존 MT 모델(NLLB 등)과 비교해 어떻게 다른가?
- RQ2few-shot 프롬프트는 ChatGPT의 MT 출력 품질을 얼마나 향상시키며, 사용자 입장에선 비용 대비 효율적인가?
- RQ3자원 수준, 문자, 어족 등 언어 수준의 특성이 ChatGPT의 번역 성능에 가장 강하게 영향을 미치는가?
- RQ4ChatGPT, GPT-4, Google Translate, NLLB 등의 시스템 간 번역 비용은 어떻게 달라지며, 사용자에게 어떤 영향을 미치는가?
- RQ5성능과 비용을 고려할 때, ChatGPT는 저자원 언어 및 아프리카 언어 사용자들에게 실용적인 번역 도구로 활용 가능할까?
주요 결과
- ChatGPT는 평가한 203개 언어 중 15.9%에서는 NLLB 성능을 따라하거나 초월하지만, 84.1%에서는 NLLB에 뒤지며 저자원 언어에 대한 심각한 한계를 보여준다.
- 고자원 언어(HRLs)에서는 ChatGPT가 경쟁 가능한 성능을 보이며, 프랑스어(chrF++: 45.8)와 스페인어(49.7) 등 일부 언어에서는 NLLB를 능가하는 성능을 기록한다.
- few-shot 프롬프트는 번역 품질 향상에 미미한 기여만을 보이며, 언어 간 일관성 없이 작은 향상만을 가져와 사용자에게는 유의미한 이점이 되지 못한다.
- 언어 자원 수준이 ChatGPT의 MT 성능를 가장 강력하게 예측하는 요소이며, 저자원 언어(LRLs)는 고자원 언어보다 훨씬 열악한 결과를 보인다.
- ChatGPT는 아프리카 언어에서 특히 열세를 보이며, 많은 언어에서 평균 chrF++ 점수가 20.0 이하로 낮다(예: 이시스와호 11.5, 티그린야 13.3). 타마셰크(1.0) 및 타마셰크(Tfng)(0.2)와 같은 언어는 매우 열악한 성능을 보인다.
- GPT-4는 테스트한 20개 언어 전부에서 ChatGPT를 뛰어넘지만, 비용이 1,900% 높아 대부분의 사용자에게는 실용적이지 않다. 성능가치가 낮더라도 ChatGPT는 여전히 더 비용 효율적이다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.