[論文レビュー] Knowledge of cultural moral norms in large language models
本研究では、55カ国における世界価値観調査(WVS)およびPewグローバル・アテイチュード調査データを用いて、単語言語の英語大規模言語モデル(LLMs)が文化的な道徳的規範をどのように表現しているかを調査する。クロスカルチャルな調査データでファインチューニングすることで、LLMsのグローバル道徳的規範予測の正確性が向上するが、英語固有の道徳的規範の正確性が低下するという代償を伴い、文化的多様性と均質的規範表現の間にはトレードオフが生じていることが明らかになった。
Moral norms vary across cultures. A recent line of work suggests that English large language models contain human-like moral biases, but these studies typically do not examine moral variation in a diverse cultural setting. We investigate the extent to which monolingual English language models contain knowledge about moral norms in different countries. We consider two levels of analysis: 1) whether language models capture fine-grained moral variation across countries over a variety of topics such as ``homosexuality'' and ``divorce''; 2) whether language models capture cultural diversity and shared tendencies in which topics people around the globe tend to diverge or agree on in their moral judgment. We perform our analyses with two public datasets from the World Values Survey (across 55 countries) and PEW global surveys (across 40 countries) on morality. We find that pre-trained English language models predict empirical moral norms across countries worse than the English moral norms reported previously. However, fine-tuning language models on the survey data improves inference across countries at the expense of a less accurate estimate of the English moral norms. We discuss the relevance and challenges of incorporating cultural knowledge into the automated inference of moral norms.
研究の動機と目的
- 単語言語の英語LLMsが多様な国々における文化的道徳的規範の知識を表現しているかどうかを評価すること。
- LLMsが文化的な違いに応じた微細な道徳的変異と、文化的な共通する道徳的傾向を捉えられるかどうかを調査すること。
- LLMsにおける英語固有の道徳的規範の正確な表現と、より広範な文化的多様性の表現の間のトレードオフを評価すること。
- グローバル道徳的アンケートデータでLLMsをファインチューニングする際、バイアスが導入されるリスクを調査すること。
提案手法
- 世界価値観調査(WVS)およびPewグローバル・アテイチュード調査の国別道徳的発言を用いて、事前に訓練された英語LLMs(例:GPT-2、Sentence-BERT)をプローブする。
- 調査の国レベル平均道徳的評価値を文化的道徳的規範の代理指標として使用する。
- WVSおよびPewデータセットを、ランダムサンプリングおよびクラスバランスサンプリング戦略を用いてファインチューニングし、クロスカルチャル推論を向上させる。
- 国ごとのモデル推定値と実証的道徳的規範との間のピアソン相関係数(r)を用いて、モデルのパフォーマンスを評価する。
- 西洋対非西洋文化グループ間のモデル予測を比較し、バイアスおよび一般化能力を評価する。
- ファインチューニング後の、均質的(英語)規範とクロスカルチャル規範のパフォーマンスのトレードオフを分析する。

実験結果
リサーチクエスチョン
- RQ1英語事前訓練言語モデルは、55カ国の文化的道徳的規範の微細な変異をどの程度反映しているか?
- RQ2英語LLMsは、世界の人々の間で共通する道徳的普遍的傾向と文化的な相違を捉えられるか?
- RQ3グローバル道徳的アンケートデータでファインチューニングすることで、モデルの英語固有の道徳的規範とクロスカルチャル道徳的規範の両方の予測能力にどのような影響を与えるか?
- RQ4支配的で文化的な視点に偏った文化的ナラティブを反映するアンケートデータでLLMsをファインチューニングする際、どのようなバイアスが導入されるおそれがあるか?
主な発見
- 事前訓練された英語LLMsは、英語規範よりもグローバル道徳的規範の予測正確性が低く、特に非西洋諸国では顕著である。
- WVSおよびPewデータセットでファインチューニングすることで、クロスカルチャル道徳的規範予測の正確性が顕著に向上し、ピアソン相関係数はWVS(ランダム戦略)でr = 0.893、PEW(ランダム戦略)でr = 0.944に達した。
- 最もパフォーマンスの優れたファインチューニングモデル(WVS、ランダム戦略)は、非西洋諸国を含むすべての国グループの規範予測で他を上回った。
- 改善にもかかわらず、西洋諸国と非西洋諸国との間でパフォーマンスのギャップが依然として存在し、モデル表現に恒常的なバイアスが残っていることが示された。
- ファインチューニングにより、英語固有の道徳的規範を推定するモデルの正確性が低下し、文化的多様性と均質的規範表現の間の明確なトレードオフが確認された。
- 本研究では、特に支配的で文化的な視点に偏った文化的ナラティブを反映するアンケートデータでファインチューニングすることで、新たな社会的・文化的バイアスが導入されるリスクを同定した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。