[论文解读] ChatGPT MT: Competitive for High- (but not Low-) Resource Languages
本研究利用 FLORES-200 基准测试评估了 ChatGPT 在 204 种语言上的机器翻译(MT)性能,与 NLLB、Google 翻译及 GPT-4 进行对比。结果表明,尽管 ChatGPT 在高资源语言上的表现与传统 MT 模型相当或更优,但在 84.1% 的评估语言中,尤其在低资源语言——特别是非洲语言上——表现显著逊色。
Large language models (LLMs) implicitly learn to perform a range of language tasks, including machine translation (MT). Previous studies explore aspects of LLMs' MT capabilities. However, there exist a wide variety of languages for which recent LLM MT performance has never before been evaluated. Without published experimental evidence on the matter, it is difficult for speakers of the world's diverse languages to know how and whether they can use LLMs for their languages. We present the first experimental evidence for an expansive set of 204 languages, along with MT cost analysis, using the FLORES-200 benchmark. Trends reveal that GPT models approach or exceed traditional MT model performance for some high-resource languages (HRLs) but consistently lag for low-resource languages (LRLs), under-performing traditional MT for 84.1% of languages we covered. Our analysis reveals that a language's resource level is the most important feature in determining ChatGPT's relative ability to translate it, and suggests that ChatGPT is especially disadvantaged for LRLs and African languages.
研究动机与目标
- 评估 ChatGPT 在涵盖大量低资源和代表性不足语言的 204 种语言上的机器翻译能力。
- 确定普通用户,特别是低资源语言(LRLs)使用者,是否可以可靠地将 ChatGPT 用作翻译工具,相比现有成熟系统。
- 分析语言资源水平、语言特征及提示工程对基于大语言模型(LLM)的 MT 性能的影响。
- 比较 ChatGPT、GPT-4、Google 翻译和 NLLB 等多个系统之间的翻译成本。
- 为终端用户和研究人员提供实用建议,明确在何种情境下以及如何在低资源环境下使用 LLM 进行翻译。
提出的方法
- 使用 FLORES-200 基准测试,对 203 种非英语语言的 1,012 个开发测试句进行评估,将英语翻译为目标语言,测试 ChatGPT(gpt-3.5-turbo)的性能。
- 通过 chrF++ 分数,将性能与 NLLB(最先进的开源 MT 模型)、Google 翻译(商业系统)以及 GPT-4(在 20 种语言子集上)进行对比。
- 测试零样本提示和五样本提示,以评估上下文示例对 LLM 翻译性能的边际增益。
- 通过决策树分析,识别与 ChatGPT MT 效果最相关的语言特征(如资源水平、书写系统、语系等)。
- 通过估算使用 OpenAI API 定价的推理成本,对每条翻译的成本进行分析,比较 ChatGPT 与其他系统的成本差异。
- 使用语言特定特征(如资源水平、书写系统、语系和地理区域)评估其对翻译质量的预测能力。

实验结果
研究问题
- RQ1ChatGPT 在广泛语言(尤其是高资源和低资源语言)上的翻译性能与传统 MT 模型(如 NLLB)相比如何?
- RQ2少样本提示在多大程度上提升了 ChatGPT 的 MT 输出质量?这种提升对终端用户而言是否具有成本效益?
- RQ3哪些语言层面的特征(如资源水平、书写系统、语系)最能预测 ChatGPT 的翻译性能?
- RQ4ChatGPT、GPT-4、Google 翻译和 NLLB 等系统之间的翻译成本如何变化?对终端用户有何影响?
- RQ5考虑到性能和成本,ChatGPT 是否适合作为低资源语言和非洲语言使用者的可靠翻译工具?
主要发现
- 在评估的 203 种语言中,ChatGPT 在 15.9% 的语言上表现与 NLLB 相当或更优,但在 84.1% 的语言上表现逊于 NLLB,表明其在低资源语言上存在显著局限。
- 对于高资源语言(HRLs),ChatGPT 表现具有竞争力,部分语言的 chrF++ 分数接近或超过 NLLB,例如法语(chrF++: 45.8)和西班牙语(49.7)。
- 少样本提示仅带来微小的质量提升,且在不同语言间无一致或显著增益,表明对终端用户而言收益有限。
- 语言资源水平是预测 ChatGPT MT 性能的最强因素,低资源语言(LRLs)的翻译结果显著劣于高资源语言。
- ChatGPT 在非洲语言上尤其处于劣势,许多语言的平均 chrF++ 分数低于 20.0,例如 isiXhosa(11.5)、Tigrinya(13.3),而 Tamashek(1.0)和 Tamashek(Tfng)(0.2)的性能极差。
- GPT-4 在所有 20 种测试语言上均优于 ChatGPT,但成本高出 1,900%,对大多数用户不切实际;尽管性能较低,ChatGPT 仍是更具成本效益的选择。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。