[论文解读] Multilingual Language Models are not Multicultural: A Case Study in Emotion
本研究调查了多语言语言模型(LMs)是否反映情绪表达中的文化差异,发现其主要呈现盎格鲁中心化特征。通过情绪嵌入和生成式LM(如GPT-3.5和GPT-4),作者表明,这些模型将情绪表征锚定于英语,在非英语语言(尤其是日语和中文)中即使以这些语言提问,也难以生成符合文化背景的情绪回应。
Emotions are experienced and expressed differently across the world. In order to use Large Language Models (LMs) for multilingual tasks that require emotional sensitivity, LMs must reflect this cultural variation in emotion. In this study, we investigate whether the widely-used multilingual LMs in 2023 reflect differences in emotional expressions across cultures and languages. We find that embeddings obtained from LMs (e.g., XLM-RoBERTa) are Anglocentric, and generative LMs (e.g., ChatGPT) reflect Western norms, even when responding to prompts in other languages. Our results show that multilingual LMs do not successfully learn the culturally appropriate nuances of emotion and we highlight possible research directions towards correcting this.
研究动机与目标
- 检验多语言LM是否在不同语言间反映情绪表达的文化差异。
- 探究多语言模型的情绪嵌入是否因训练数据偏差而锚定于英语。
- 评估生成式LM在非英语语言提示下是否能生成符合文化背景的情绪回应。
- 通过人工标注评估,检验LM在情绪生成中的文化意识。
- 指出零样本多语言迁移在情感敏感NLP应用中的局限性。
提出的方法
- 比较单语、多语及对齐的RoBERTa模型的情绪嵌入,评估其与英语的一致性。
- 将情绪嵌入投影到效价-唤醒平面,可视化美国与日本语境下骄傲与羞耻情绪的文化差异。
- 分析GPT-3的概率分布,检测骄傲与羞耻情绪词汇在文化间的使用差异。
- 使用相同场景在英语和母语(日语、中文、西班牙语)中提示GPT-3.5和GPT-4,分别使用英语和母语语境提示。
- 通过母语者用户研究,评估LM生成情绪回应的文化恰当性。
- 使用人工标注分数评估模型表现,通过Cohen’s kappa测量标注者间一致性。

实验结果
研究问题
- RQ1多语言语言模型的嵌入是否反映已知的心理学文化差异在情绪表达中的体现?
- RQ2多语言LM中的情绪嵌入在多大程度上因训练数据偏差而锚定于英语?
- RQ3当以非英语语言提示时,生成式LM(如GPT-3.5和GPT-4)是否能生成符合文化背景的情绪回应?
- RQ4文化语境模式(英语提示 vs. 母语提示)如何影响LM生成情绪回应的文化恰当性?
- RQ5多语言LM能否在无显式文化线索的情况下准确推断情绪表达的文化规范?
主要发现
- 如XLM-RoBERTa等多语言LM的情绪嵌入锚定于英语,对非英语语言的文化区分度较弱。
- 当使用母语提示时,GPT-4在日语和中文中生成的回应显著不如英语提示下具有文化恰当性。
- GPT-3.5和GPT-4的英语完成文本始终被评价为更具文化意识,无论提示语境如何,其质量在英语中最高。
- 当使用母语文化语境提示时,模型在东方语言中的回应质量显著下降,表明其无法仅通过语言本身推断文化规范。
- 西方语言与东方语言回应在文化恰当性上存在显著差异,西方语言(英语、西班牙语)的标注得分高于东方语言(中文、日语)。
- 当以非英语语言提示时,GPT-3.5和GPT-4无法生成符合本土文化规范的回应,反而反映出西方情绪表达模式。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。