Skip to main content
QUICK REVIEW

[論文レビュー] Large language models can replicate cross-cultural differences in personality

Paweł Niszczota, Mateusz Janczak|arXiv (Cornell University)|Oct 12, 2023
Mental Health Research Topics被引用数 6
ひとこと要約

本研究では、GPT-4などの大規模言語モデル(LLM)が、大規模なシミュレーション(N=8,000)を用いて、グレート・ファイブ性格特性における文化的な違いを再現できるかを調査した。GPT-4は米国と韓国における文化的文脈の期待される性格の違いを成功裏に再現したが、人間のデータと比較して平均スコアに上昇バイアスが生じ、分散が低減していた。

ABSTRACT

We use a large-scale experiment (N=8000) to determine whether GPT-4 can replicate cross-cultural differences in the Big Five, measured using the Ten-Item Personality Inventory. We used the US and South Korea as the cultural pair, given that prior research suggests substantial personality differences between people from these two countries. We manipulated the target of the simulation (US vs. Korean), the language of the inventory (English vs. Korean), and the language model (GPT-4 vs. GPT-3.5). Our results show that GPT-4 replicated the cross-cultural differences for each factor. However, mean ratings had an upward bias and exhibited lower variation than in the human samples, as well as lower structural validity. We provide preliminary evidence that LLMs can aid cross-cultural researchers and practitioners.

研究の動機と目的

  • 大規模言語モデル(LLM)が、人間集団で観察された文化的に異なる性格プロファイルをシミュレートできるかどうかを検討すること。
  • LLMが生成した性格スコアの構造的妥当性と正確性を、実際の人間データと比較して評価すること。
  • 文化的なターゲット、評価言語、モデルタイプ(GPT-4 対 GPT-3.5)が、性格シミュレーションの正確性に与える影響を評価すること。
  • LLMが文化的な性格研究や実用的応用のための信頼できるツールとして機能できるかどうかを検討すること。
  • 特に平均値と分散において、LLMが生成した性格スコアに系統的なバイアスが存在するかどうかを同定すること。

提案手法

  • グレート・ファイブ特性を評価するための「十項目性格インVENTORY(TIPI)」を用いて、8,000件のLLM生成回答を含む大規模な実験的シミュレーションを実施した。
  • 文化的ターゲット(米国 対 韓国)、TIPIの言語(英語 対 韓国語)、LLM(GPT-4 対 GPT-3.5)という3つの主要な条件を変化させた。
  • 米国および韓国からの個人を模倣する制御されたプロンプトを用いて、GPT-4およびGPT-3.5が性格回答を生成した。
  • 文化的および言語的条件の下で回答を収集・分析し、平均スコアと内部的一致性を比較した。
  • 確認的要因分析を用いて、LLM生成回答の内部的要因構造を検証することで、構造的妥当性を評価した。
  • LLM生成性格プロファイルを、米国および韓国集団からの既存の人間データと比較し、再現の正確性を評価した。

実験結果

リサーチクエスチョン

  • RQ1GPT-4は、人間集団で観察された米国と韓国間のグレート・ファイブ性格特性における文化的な違いを再現できるか?
  • RQ2文化的ターゲットや評価言語の変化が、LLMにおける性格シミュレーションの正確性にどのように影響するか?
  • RQ3LLMが生成した性格スコアは、人間データと比較してどの程度構造的妥当性を示すか?
  • RQ4LLMが生成した性格スコアは、実際の人間の反応と比較して、平均値や分散に系統的なバイアスを示すか?
  • RQ5GPT-4のようなLLMは、文化的な性格研究や実用的応用のための信頼できるツールとして機能できるか?

主な発見

  • GPT-4は、米国と韓国における文化的な違いについて、グレート・ファイブ性格特性のすべての5つの次元で期待される違いを成功裏に再現した。
  • LLMが生成した性格スコアは、両方の文化的グループの人間データと比較して、平均スコアに一貫した上昇バイアスを示した。
  • LLMが生成した回答の分散は、人間集団のものと比較して顕著に低く、模擬された性格表現の多様性が低減していた。
  • LLMが生成した回答の構造的妥当性は、人間データよりも低く、グレート・ファイブ次元の内部的要因構造が弱まっていた。
  • シミュレーションの正確性は、GPT-4とGPT-3.5の間で一貫しており、GPT-4はわずかに期待される文化的な違いとの整合性が高かった。
  • インベントリの言語(英語 対 韓国語)が差の大きさにほとんど影響を及ぼさなかったため、この文脈ではモデルの性能が多言語にわたって頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。