[論文レビュー] Towards Measuring and Modeling "Culture" in LLMs: A Survey
このサーベイは、大規模言語モデル(LLM)における文化的表現に関する39篇のNLP論文を分析し、文化の定義の欠如、意味的ドメインやaboutnessなどの未開拓な文化的プロキシ、およびレジliビリティと解釈可能性に欠けるメソッドロジカルな弱みを特定している。本研究は、人種的・文化的・言語的次元にわたる文化的プロキシを分類するフレームワークを提唱し、包括的で、レジリエントで、多様な分野にまたがる研究を促進することで、LLMにおける包括的な文化的表現の実現を目指している。
We present a survey of more than 90 recent papers that aim to study cultural representation and inclusion in large language models (LLMs). We observe that none of the studies explicitly define "culture, which is a complex, multifaceted concept; instead, they probe the models on some specially designed datasets which represent certain aspects of "culture". We call these aspects the proxies of culture, and organize them across two dimensions of demographic and semantic proxies. We also categorize the probing methods employed. Our analysis indicates that only certain aspects of ``culture,'' such as values and objectives, have been studied, leaving several other interesting and important facets, especially the multitude of semantic domains (Thompson et al., 2020) and aboutness (Hershcovich et al., 2022), unexplored. Two other crucial gaps are the lack of robustness of probing techniques and situated studies on the impact of cultural mis- and under-representation in LLM-based applications.
研究の動機と目的
- 最近のLLMに関するNLP研究における文化の研究方法、特にバイアスと表現に関する関連性を分析すること。
- 研究間で文化的定義が一貫していないこと、その結果生じる研究の断片化を特定すること。
- 39篇のサーベイ論文にわたるデータセットで用いられている文化的プロキシ(人種的・文化的・言語的)を、人種的・意味的・言語的文化的次元に分類すること。
- aboutness、親族関係、時間、身体的・精神的世界観といった未開拓な文化的次元を浮き彫りにすること。
- 意味のある文化的包含を実現するため、よりレジリエントで解釈可能で、多言語的かつ多様な分野にまたがる研究を促すこと。
提案手法
- LLMにおける文化的表現、バイアス、認識に関する最近のNLP論文39篇を体系的にサーベイした。
- 文化的プロキシを3つの次元に分類した:人種的(例:地域、宗教)、意味的(例:価値観、規範)、言語的文化的(例:丁寧さ、話し方のスタイル)。
- 研究で用いられたプローブ手法を分析し、ブラックボックス型プロンプトへの依存と、ホワイトボックス型解釈可能性技術の欠如を特定した。
- データセットの制限を評価した。特に、英語データの優位性と文化的要素の翻訳不能性に注目した。
- 研究設計の明確化と再現可能性を可能にするために、データセットと文化的プロキシを明示的に結びつける概念的フレームワークを提唱した。
- 文化的文脈の文脈的・複雑なダイナミクスを理解する上で関連性の高い人類学やHCI分野との連携を促進した。

実験結果
リサーチクエスチョン
- RQ1最近のLLMに関するNLP研究では、文化はどのように定義されたり、操作的に扱われているか?
- RQ2人種的・意味的・言語的文化的プロキシの中で、LLM評価において最も頻繁に研究されたのはどれか?
- RQ3意味的ドメインとしてのaboutness、親族関係、時間といった文化的表現の主なギャップは何か?
- RQ4現在のプローブ手法はどの程度レジリエントで解釈可能であり、それらが結果の信頼性にどのように影響しているか?
- RQ5多様な分野にまたがる研究と多言語的アプローチは、LLMにおける文化的包含をどのように向上させ得るか?
主な発見
- サーベイした39篇の論文すべてが文化的定義を批判的・詳細に提示しておらず、曖昧または高レベルの記述に依存している。
- 研究の多くは価値観や目的といった限定的な文化的プロキシに集中しており、aboutness や親族関係、機能語などの意味的ドメインは未開拓のままである。
- プローブ手法は主にブラックボックス型であり、プロンプト構造に敏感であるため、結果のレジリエンスと一般化可能性に懸念が生じる。
- 多言語データセットの著しい不足があり、多くの研究が英語のみのデータに依存しており、文化的な妥当性の跨文化的適用が制限されている。
- 人類学やHCI分野との連携は最小限にとどまっており、文化的文脈の文脈的で複雑なダイナミクスを理解する上で関連性があるにもかかわらず。
- 本サーベイは、データセットと文化的プロキシを明示的に結びつける包括的で、レジリエントで、解釈可能で、包摂的なLLM評価を支援する、一貫した研究フレームワークの必要性を強く指摘している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。