Skip to main content
QUICK REVIEW

[論文レビュー] Not All Countries Celebrate Thanksgiving: On the Cultural Dominance in Large Language Models

Wenxuan Wang, Wenxiang Jiao|arXiv (Cornell University)|Oct 19, 2023
Topic Modeling被引用数 5
ひとこと要約

この論文は、大規模言語モデル(LLM)における文化的優位性を特定し、GPT-4などのモデルが、非英語の言語でプロンプトされた場合でさえも、英語文化関連の応答を顕著に生成することを示している。コンcreteな文化的対象(例:祝日、音楽)と抽象的な文化的対象の多言語ベンチマークを用いて、GPT-4は最も強い文化的バイアスを示したが、非英語データで事前学習することと文化的意識を持つプロンプトの使用により、この問題は顕著に緩和された。

ABSTRACT

This paper identifies a cultural dominance issue within large language models (LLMs) due to the predominant use of English data in model training (e.g., ChatGPT). LLMs often provide inappropriate English-culture-related answers that are not relevant to the expected culture when users ask in non-English languages. To systematically evaluate the cultural dominance issue, we build a benchmark of concrete (e.g., holidays and songs) and abstract (e.g., values and opinions) cultural objects. Empirical results show that the representative GPT models suffer from the culture dominance problem, where GPT-4 is the most affected while text-davinci-003 suffers the least from this problem. Our study emphasizes the need to critically examine cultural dominance and ethical consideration in their development and deployment. We show that two straightforward methods in model development (i.e., pretraining on more diverse data) and deployment (e.g., culture-aware prompting) can significantly mitigate the cultural dominance issue in LLMs.

研究の動機と目的

  • 大規模言語モデル(LLM)が、主に英語データで学習しているために文化的優位性を示す程度を調査すること。
  • 特に文化的関連性と正確性の観点から、LLMが非英語言語で文化的な質問にどのように反応するかを検討すること。
  • 2つの緩和戦略の有効性を評価すること:より多様なデータでの事前学習と文化的意識を持つプロンプトの使用。
  • LLMにおける文化的バイアスに関連する倫理的懸念を強調し、より包括的なモデル開発と展開を提言すること。
  • 複数の言語と文化的次元(具体的および抽象的)で文化的優位性を測定するためのベンチマークを確立すること。

提案手法

  • 11の言語で、具体的な文化的対象(例:祝日、楽曲)に関する8つの質問セットを含む多言語ベンチマークを構築した。
  • 社会科学分野の2つの既存の多言語世論調査を統合し、抽象的な文化的価値観と意見を評価した。
  • GPT-4、text-davinci-003、ChatGPTといった最先端のGPTモデルを、明示的な文化的文脈なしにゼロショットプロンプトで評価した。
  • 入力プロンプトにターゲット文化を明示することで文化的意識を持つプロンプトを適用し、応答の関連性に与える影響を評価した。
  • より多様な非英語データ分布でモデルを事前学習することで、トレーニングデータ構成が文化的バイアスに与える影響を評価した。
  • 内部モデルパラメータにアクセスできないブラックボックス評価を用い、文化的関連性と正確性に焦点を当ててモデル出力を分析した。

実験結果

リサーチクエスチョン

  • RQ1LLMが非英語言語でプロンプトされた場合、文化的に不適切または関連のない応答をどれほど生成するのか?
  • RQ2GPTファミリーの異なるモデル、特にGPT-4とtext-davinci-003において、LLMの文化的優位性はどのように変動するか?
  • RQ3より多様で非英語のデータで事前学習することで、LLMにおける文化的優位性を軽減できるか?
  • RQ4文化的意識を持つプロンプトは、LLMの応答の文化的関連性を向上させるのにどれほど効果的か?
  • RQ5文化的優位性の影響は、具体的な文化的対象(例:祝日)よりも抽象的な文化的価値観(例:政治的意見)に強く現れるか?

主な発見

  • GPT-4は、非英語言語でプロンプトされた場合でも、英語文化関連の応答を顕著に生成し、最も強い文化的優位性を示した。
  • 評価されたGPTモデルの中で、text-davinci-003は文化的優位性の影響を最も受けにくく、出力のバイアスが低いことが示された。
  • より多様で非英語のデータで事前学習することで、文化的優位性が顕著に軽減された。これは、データ構成がこの問題の根本的原因である可能性を示唆している。
  • 文化的意識を持つプロンプトは、祝祭日や楽曲といった具体的な文化的対象の応答の関連性を効果的に向上させた。
  • 文化的意識を持つプロンプトは、抽象的な文化的価値観や意見に対してはあまり効果がなく、表面的な手がかりを超えた深い文化的理解が求められるためである。
  • 本研究は、文化的優位性が単一の地域や言語に限らず、複数の言語と文化的次元にわたり広く存在することを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。