[論文レビュー] Assessing LLMs for Moral Value Pluralism
本稿では、大規模言語モデル(LLM)における暗黙の道徳的価値を評価する手法を提案する。RVR(価値共鳴認識)モデルを用い、LLMが出力するテキストを世界価値調査(WVS)と比較することで、特にWEIRD(西洋的・教育的・工業的・豊かな・民主的)バイアスと年齢関連の不正確さを示す顕著な道徳的価値の不一致が、非WEIRD諸国および文化的・人口統計的グループにおいて明らかになった。
The fields of AI current lacks methods to quantitatively assess and potentially alter the moral values inherent in the output of large language models (LLMs). However, decades of social science research has developed and refined widely-accepted moral value surveys, such as the World Values Survey (WVS), eliciting value judgments from direct questions in various geographies. We have turned those questions into value statements and use NLP to compute to how well popular LLMs are aligned with moral values for various demographics and cultures. While the WVS is accepted as an explicit assessment of values, we lack methods for assessing implicit moral and cultural values in media, e.g., encountered in social media, political rhetoric, narratives, and generated by AI systems such as LLMs that are increasingly present in our daily lives. As we consume online content and utilize LLM outputs, we might ask, which moral values are being implicitly promoted or undercut, or -- in the case of LLMs -- if they are intending to represent a cultural identity, are they doing so consistently? In this paper we utilize a Recognizing Value Resonance (RVR) NLP model to identify WVS values that resonate and conflict with a given passage of output text. We apply RVR to the text generated by LLMs to characterize implicit moral values, allowing us to quantify the moral/cultural distance between LLMs and various demographics that have been surveyed using the WVS. In line with other work we find that LLMs exhibit several Western-centric value biases; they overestimate how conservative people in non-Western countries are, they are less accurate in representing gender for non-Western countries, and portray older populations as having more traditional values. Our results highlight value misalignment and age groups, and a need for social science informed technological solutions addressing value plurality in LLMs.
研究の動機と目的
- AIが生成するテキストにおける暗黙の道徳的・文化的価値を評価する手法の不足、特に非WEIRD文化的文脈においてその課題を解決すること。
- LLMが多様な道徳的視点、特に代表が不足している国々や年齢層のものについて正確に表現しているかどうかを調査すること。
- 大規模言語モデルが出力する回答と、世界価値調査(WVS)の実世界のアンケートデータとの間の道徳的・文化的距離を定量化すること。
- 訓練データに内在するバイアスを踏まえ、LLMが普遍的または平均的な人間の道徳的見解を反映しているという仮定を疑うこと。
- LLMの出力に内在する暗黙の価値多様性を特定・測定することで、倫理的整合性のあるAIの開発を支援すること。
提案手法
- RVR(価値共鳴認識)自然言語処理モデルを用い、与えられたテキストがWVSのどの道徳的価値と共鳴するか、または矛盾するかを特定する。
- LLMが出力する回答に対して、特定の人口統計的属性(例:「日本の60歳の人がXについてどう考えるだろうか?」)を想定したプロンプトを適用し、RVRを適用する。
- LLMが出力した回答と、同じ人口統計的グループの実際のWVSアンケート結果を比較し、道徳的/文化的距離を算出する。
- 伝統的価値対世俗的価値のスケールに一致するWVSの質問のサブセットを用い、LLM出力における価値多様性を評価する。
- 文化的一貫性とバイアスを評価するために、伝統、個人主義、世俗主義、自律性に関連する道徳的価値に焦点を当てる。
- WVSを妥当性が保証された国際的ベンチマークとして用い、LLM出力に内在する暗黙の道徳的価値を基準づけ、評価する。

実験結果
リサーチクエスチョン
- RQ1LLMは、世界価値調査(WVS)で測定された非WEIRD諸国の道徳的価値をどの程度正確に反映しているか。
- RQ2LLMの道徳的見解は、伝統的価値対世俗的価値という観点から、実際の人口統計的回答と比べてどのように異なるか。
- RQ3LLMは年齢に起因する道徳的価値表現の不一致を示しており、特に若年層の価値観が過剰に反映されているか。
- RQ4WVSの文化的マップ上の異なる文化的クラスタにおいて、LLMの価値整合性はどのように変化するか。
- RQ5RVRモデルは、実世界のアンケートデータと比較して、LLM出力における暗黙の道徳的価値多様性または不一致を効果的に検出できるか。
主な発見
- LLMは非WEIRD諸国の道徳的価値と顕著な不一致を示しており、特に実際のWVSアンケート結果とは一致しない伝統的価値の肯定的表現が顕著である。
- LLMは高齢者のデモグラフィックグループに対して、世俗的価値を過剰に反映し、伝統的価値を低く評価しており、多くの文化において高齢者に高い伝統主義が見られるというWVSデータとは矛盾している。
- LLMはWEIRD道徳バイアスを示しており、西洋的・英語話者・若年層・教育を受けた人々に支配的な価値を一貫して反映している。
- モデルの回答は、年齢層の道徳的見解に比べて若年層の価値観に著しく一致しており、年配のアイデンティティを想定したプロンプトに対しても同様の傾向を示している。
- RVRモデルは、LLM出力とWVSデータとの間の価値共鳴や矛盾を効果的に同定でき、道徳的・文化的距離の定量的評価を可能にした。
- これらの結果から、LLMは中立的またはグローバルな道徳的価値多様性を反映しているのではなく、訓練データに内在する支配的で文化的・言語的バイアスを反映していることが示唆された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。