[论文解读] Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language Models
本研究探讨将多语言查询翻译成英语是否对大型语言模型(LLMs)最优,发现尽管翻译能提升英语中心型LLMs在非英语NLP任务中的表现,但在文化密集型任务中,使用原生语言提示的表现更优。主要贡献在于倡导开发在所有语言上均具备同等能力的多语言LLMs,而非依赖翻译作为万能解决方案。
Large language models (LLMs) have demonstrated multilingual capabilities, yet they are mostly English-centric due to the imbalanced training corpora. While prior works have leveraged this bias to enhance multilingual performance through translation, they have been largely limited to natural language processing (NLP) tasks. In this work, we extend the evaluation to real-world user queries and non-English-centric LLMs, offering a broader examination of multilingual performance. Our key contribution lies in demonstrating that while translation into English can boost the performance of English-centric LLMs on NLP tasks, it is not universally optimal. For culture-related tasks that need deep language understanding, prompting in the native language proves more effective as it better captures the nuances of culture and language. Our experiments expose varied behaviors across LLMs and tasks in the multilingual context, underscoring the need for a more comprehensive approach to multilingual evaluation. Therefore, we call for greater efforts in developing and evaluating LLMs that go beyond English-centric paradigms.
研究动机与目标
- 评估将多语言查询翻译成英语以提升LLMs在多种语言上表现的有效性。
- 在真实世界和NLP基准场景中,对比基于翻译的提示、原生语言提示及跨语言提示策略。
- 探究英语中心型LLMs是否从翻译中受益,或原生语言提示在文化细腻任务中是否表现更优。
- 评估为非英语语言优化的多语言LLMs在需要深层文化理解的任务中的表现。
- 倡导开发真正意义上的多语言LLMs,实现所有语言能力均衡,而非依赖翻译作为权宜之计。
提出的方法
- 在多个LLMs(如Llama-2、Mistral、Llama-70B、ChatGPT)和翻译工具(Google Translate、NLLB、XLT)上开展受控实验,对比不同提示策略。
- 评估多种提示策略:原生语言基础提示、原生语言思维链(CoT)、英语基础提示、英语思维链(CoT)、XLT(跨语言迁移)以及通过Google/NLLB的翻译。
- 使用标准化基准测试:MKQA(多语言问答)、M3Exam(多语言推理)和XL-sum(多语言摘要)用于NLP任务。
- 使用来自ShareGPT的真实多语言用户查询,评估在开放性、非结构化场景下的实际表现。
- 采用GPT-4-Turbo作为裁判模型,通过LLM-as-a-judge提示评估响应质量,确保一致性和可靠性。
- 设计提示以检测请求是否需要本地文化知识,从而实现对文化敏感型任务的针对性分析。
实验结果
研究问题
- RQ1将多语言查询翻译成英语是否在英语中心型LLMs的多种NLP任务中始终提升性能?
- RQ2在真实世界的多语言用户查询中,原生语言提示与基于翻译的提示相比表现如何?
- RQ3在何种情况下翻译会降低性能,特别是在需要文化或语言细微差别的任务中?
- RQ4为非英语语言优化的多语言LLMs在以母语提示时,是否能超越英语中心型模型?
- RQ5翻译是否足以实现稳健的多语言性能,抑或需要真正意义上的多语言模型?
主要发现
- 对于低资源语言,翻译成英语可显著提升性能,例如Trans-Google在Llama-2-70B-Chat的土耳其语MKQA任务中达到47.9的F1分数。
- 在文化相关任务中,使用原生语言提示表现更优——例如,Llama-2-70B-Chat在中文XL-sum任务中使用原生提示获得39.7的ROUGE-1分数,优于基于翻译的方法。
- 对于高资源语言如中文和法语,使用思维链(CoT)的原生语言提示始终优于翻译,例如Llama-2-70B-Chat在法语任务中使用原生CoT获得34.5的ROUGE-1分数。
- 基于翻译的提示(如Trans-Google)在语言无关任务(如MGSM数学题)中提升了性能,但在依赖文化的任务中表现下降,例如需要本地语境的中文问题。
- 为非英语语言优化的多语言LLMs在原生语言任务中表现更强,表明语言特定微调有助于提升对文化细微差别的理解。
- 研究结论认为,翻译并非普遍最优,开发真正意义上的多语言LLMs对于克服英语中心型模型的局限性至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。