[论文解读] Don't Trust ChatGPT when Your Question is not in English: A Study of Multilingual Abilities and Types of LLMs
本研究提出了一套新颖的框架,用于系统评估大型语言模型(LLMs)的多语言能力,揭示出如 GPT-3.5 这类模型表现出从属多语言性——严重依赖英语作为推理的母语,导致在非英语输入中性能下降,尤其在翻译变异任务中表现更差。作者提出响应反向翻译(RBT)以评估语言依赖性表现,并将任务分为三类:推理、知识访问和表达。
Large Language Models (LLMs) have demonstrated exceptional natural language understanding abilities and have excelled in a variety of natural language processing (NLP)tasks in recent years. Despite the fact that most LLMs are trained predominantly in English, multiple studies have demonstrated their comparative performance in many other languages. However, fundamental questions persist regarding how LLMs acquire their multi-lingual abilities and how performance varies across different languages. These inquiries are crucial for the study of LLMs since users and researchers often come from diverse language backgrounds, potentially influencing their utilization and interpretation of LLMs' results. In this work, we propose a systematic way of qualifying the performance disparities of LLMs under multilingual settings. We investigate the phenomenon of across-language generalizations in LLMs, wherein insufficient multi-lingual training data leads to advanced multi-lingual capabilities. To accomplish this, we employ a novel back-translation-based prompting method. The results show that GPT exhibits highly translating-like behaviour in multilingual settings.
研究动机与目标
- 系统分析大型语言模型(LLMs)的多语言能力,尤其关注语言选择对性能的影响。
- 探究在主要基于英语数据训练的 LLM 中,跨语言泛化的基本机制。
- 基于其对输入语言的敏感性,将语言依赖性任务划分为三类:推理、知识访问和表达。
- 使用一种新颖的提示技术,评估 LLM 是否表现出复合、并列或从属多语言性。
- 识别当前 LLM 在处理非英语输入时的局限性,特别是在翻译变异任务中。
提出的方法
- 提出一种新颖的提示方法——响应反向翻译(RBT),即把模型输出翻译回输入语言,以评估其一致性和准确性。
- 将 NLP 任务划分为三类:推理(语言敏感度最低)、知识访问(中等敏感度)和表达(语言敏感度最高)。
- 采用对比评估框架:以多种语言输入任务,生成模型响应,再将响应反向翻译回原始语言进行对比。
- 通过人工评估验证英语、西班牙语和中文下的模型输出,重点关注正确性和语言一致性。
- 将该框架应用于评估 GPT-3.5 和 Llama2 在谐音双关检测、翻译和事实知识等任务中的表现,识别出在非英语环境下的性能下降。
- 基于双语主义的语言类型学(复合、并列、从属)分析 LLM 行为及其内部表征。
实验结果
研究问题
- RQ1当输入语言非英语时,GPT-3.5 等 LLM 在跨语言间的泛化能力如何?
- RQ2LLM 在不同类型的语言依赖性任务(推理、知识访问、表达)中的表现有何差异?
- RQ3基于其响应模式和反向翻译一致性,LLM 表现出的是复合、并列还是从属多语言性?
- RQ4为何当输入语言为非英语时,LLM 在翻译变异任务中的表现劣于翻译等变任务?
- RQ5能否通过双语主义的语言类型学系统地分类和评估 LLM 的多语言行为?
主要发现
- GPT-3.5 在翻译等变任务(如事实知识、推理)中,无论输入语言为何,均表现出强劲性能,表明其具备强大的跨语言泛化能力。
- 当输入语言非英语时,LLM 在翻译变异任务(如谐音双关检测、语言特异性表达)中的表现显著下降,表明存在语言依赖性限制。
- 该模型明显表现出从属多语言性,即使在以其他语言提示时,仍严重依赖英语作为推理和输出生成的母语。
- 响应反向翻译(RBT)成功识别出性能不一致和语言漂移现象,尤其在非英语输入中,验证了其作为诊断工具的有效性。
- Llama2 表现出显著局限性:频繁拒绝响应,自动默认使用英语,且在非英语环境下生成内容贫乏或逻辑混乱的输出。
- 本研究结论认为,当前 LLM 并非真正意义上的复合多语言模型,训练数据不平衡以及缺乏平行语料库限制了跨语言共享、通用表征的发展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。