[论文解读] Towards Measuring and Modeling "Culture" in LLMs: A Survey
本综述分析了39篇关于大语言模型(LLMs)中文化表征的NLP论文,揭示了在文化定义、文化代理(如语义领域和主题)方面存在的空白,以及在鲁棒性和可解释性方面的研究方法薄弱。该研究提出了一套框架,用于在人口统计、语义和语言-文化维度上对文化代理进行分类,并呼吁开展跨学科、多语言且具有鲁棒性的研究,以实现LLMs中全面的文化包容性。
We present a survey of more than 90 recent papers that aim to study cultural representation and inclusion in large language models (LLMs). We observe that none of the studies explicitly define "culture, which is a complex, multifaceted concept; instead, they probe the models on some specially designed datasets which represent certain aspects of "culture". We call these aspects the proxies of culture, and organize them across two dimensions of demographic and semantic proxies. We also categorize the probing methods employed. Our analysis indicates that only certain aspects of ``culture,'' such as values and objectives, have been studied, leaving several other interesting and important facets, especially the multitude of semantic domains (Thompson et al., 2020) and aboutness (Hershcovich et al., 2022), unexplored. Two other crucial gaps are the lack of robustness of probing techniques and situated studies on the impact of cultural mis- and under-representation in LLM-based applications.
研究动机与目标
- 分析近期NLP研究中关于LLMs的文化研究方式,特别是与偏见和表征的关系。
- 识别出各研究中缺乏一致的文化定义,导致研究碎片化。
- 对39篇综述论文中的数据集所使用的文化代理(人口统计、语义和语言-文化)进行分类。
- 强调尚未充分探索的文化维度,如主题(aboutness)、亲属关系、时间以及身体/心理世界概念。
- 呼吁开展更具鲁棒性、可解释性、多语言和跨学科的研究,以实现LLMs中真正意义上的文化包容。
提出的方法
- 系统性地调研了39篇近期关于LLMs中文化表征、偏见或意识的NLP论文。
- 将文化代理分为三个维度:人口统计(如地区、宗教)、语义(如价值观、规范)和语言-文化(如礼貌、言语风格)。
- 分析研究中使用的探针方法,识别出对黑箱提示的依赖以及缺乏白箱可解释性技术。
- 评估数据集的局限性,特别是英语数据的主导地位以及文化元素的不可翻译性。
- 提出一个概念性框架,以明确将数据集与文化代理关联,从而支持更清晰的研究设计和可复现性。
- 倡导与人类学和人机交互(HCI)领域开展跨学科合作,以更好地理解AI中的情境化文化背景。

实验结果
研究问题
- RQ1当前NLP研究中如何定义或操作化LLMs中的文化?
- RQ2在LLM评估中,哪些文化代理——人口统计、语义或语言-文化——被最频繁研究?
- RQ3在文化表征方面存在哪些主要空白,特别是关于主题、亲属关系和时间等语义领域?
- RQ4当前探针方法的鲁棒性和可解释性如何?它们如何影响研究结果的可靠性?
- RQ5如何通过跨学科和多语言方法提升LLMs中的文化包容性?
主要发现
- 在所调研的39篇论文中,没有一篇提供了对文化的批判性或详细定义,而是依赖于模糊或高层次的描述。
- 仅有一小部分文化代理(主要是价值观和目标)被研究,而语义领域如主题(aboutness)、亲属关系和功能词等仍处于未被探索状态。
- 探针方法主要为黑箱操作,对提示结构敏感,引发对结果鲁棒性和泛化能力的担忧。
- 多语言数据集严重缺乏,大多数研究依赖英语数据,限制了跨文化有效性的验证。
- 尽管人类学和HCI在理解情境化和复杂文化动态方面具有相关性,但与这些领域的跨学科合作仍极为有限。
- 本综述识别出迫切需要一个连贯的研究框架,明确将数据集与文化代理关联,以支持LLMs在鲁棒性、可解释性和包容性方面的评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。