[论文解读] Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in Large Language Models
本文识别出大型语言模型(LLMs)中的文化主导现象,即模型如GPT-4即使在非英语提示下,也过度生成与英语文化相关的内容。通过使用涵盖具体与抽象文化对象的多语言基准测试,研究发现GPT-4表现出最显著的文化偏见,而通过在多样化非英语数据上进行预训练以及采用文化意识提示,可显著缓解此问题。
This paper identifies a cultural dominance issue within large language models (LLMs) due to the predominant use of English data in model training (e.g., ChatGPT). LLMs often provide inappropriate English-culture-related answers that are not relevant to the expected culture when users ask in non-English languages. To systematically evaluate the cultural dominance issue, we build a benchmark of concrete (e.g., holidays and songs) and abstract (e.g., values and opinions) cultural objects. Empirical results show that the representative GPT models suffer from the culture dominance problem, where GPT-4 is the most affected while text-davinci-003 suffers the least from this problem. Our study emphasizes the need to critically examine cultural dominance and ethical consideration in their development and deployment. We show that two straightforward methods in model development (i.e., pretraining on more diverse data) and deployment (e.g., culture-aware prompting) can significantly mitigate the cultural dominance issue in LLMs.
研究动机与目标
- 调查大型语言模型(LLMs)因在以英语为主的数据上进行训练,而表现出文化主导现象的程度。
- 研究LLMs在非英语语言下对文化相关问题的响应情况,特别是其文化相关性与准确性。
- 评估两种缓解策略的有效性:在更丰富的数据上进行预训练以及采用文化意识提示。
- 强调LLMs中文化偏见相关的伦理问题,并倡导更加包容的模型开发与部署。
- 建立一个多语言、多文化维度(具体与抽象)的文化主导性测量基准。
提出的方法
- 构建了一个多语言基准,包含十一门语言中关于具体文化对象(如节日、歌曲)的八个问题集。
- 整合了两份来自社会科学的现有多语言公众意见调查,以评估抽象文化价值观与观点。
- 使用零样本提示法评估最先进的GPT模型(GPT-4、text-davinci-003和ChatGPT),未在提示中明确提供文化背景。
- 通过在输入提示中明确指定目标文化,应用文化意识提示,以评估其对响应相关性的影响。
- 在更丰富、非英语的数据分布上微调一个模型,以评估训练数据构成对文化偏见的影响。
- 采用黑箱评估方法分析模型输出,无需访问内部模型参数,重点考察文化相关性与准确性。
实验结果
研究问题
- RQ1当以非英语语言进行提示时,LLMs在多大程度上会生成文化上不恰当或不相关的回应?
- RQ2LLMs的文化主导现象在GPT系列的不同模型之间如何变化,特别是GPT-4与text-davinci-003之间?
- RQ3在更丰富、非英语的数据上进行预训练,是否能减少LLMs中的文化主导现象?
- RQ4文化意识提示在提升LLMs回应的文化相关性方面有多有效?
- RQ5文化主导现象在具体文化对象(如节日)还是抽象文化价值观(如政治观点)中表现得更强烈?
主要发现
- GPT-4表现出最强的文化主导现象,即使在非英语语言提示下,也生成大量与英语文化相关的内容。
- 在所评估的GPT模型中,text-davinci-003受文化主导现象影响最小,表明其输出偏见较低。
- 在更丰富、非英语的数据上进行预训练,可显著减少文化主导现象,表明数据构成是该问题的根本原因。
- 文化意识提示能有效提升具体文化对象(如节日、歌曲)回应的相关性。
- 文化意识提示在抽象文化价值观与观点方面效果较弱,因为这些内容需要超越表面线索的深层文化理解。
- 研究发现,文化主导现象是跨多种语言和文化维度普遍存在的问题,不限于单一地区或语言。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。