Skip to main content
QUICK REVIEW

[論文レビュー] Ethical Reasoning and Moral Value Alignment of LLMs Depend on the Language we Prompt them in

Utkarsh Agarwal, Kumar Tanmay|arXiv (Cornell University)|Apr 29, 2024
Business Law and Ethics被引用数 4
ひとこと要約

本研究は、異なる言語で言語モデルにプロンプトを提示することによる倫理的推論および道徳的価値の整合性への影響を調査する。6つの言語における倫理的ジレンマを用いて、GPT-4は一貫性があり、バイアスが少ない推論を示す一方、ChatGPTおよびLlama2-70B-Chatは、特にヒンディ語やスワヒリ語のような低リソース言語において顕著な言語依存的道徳バイアスを示す。これは、言語が言語モデルの倫理的判断に深く影響することを示している。

ABSTRACT

Ethical reasoning is a crucial skill for Large Language Models (LLMs). However, moral values are not universal, but rather influenced by language and culture. This paper explores how three prominent LLMs -- GPT-4, ChatGPT, and Llama2-70B-Chat -- perform ethical reasoning in different languages and if their moral judgement depend on the language in which they are prompted. We extend the study of ethical reasoning of LLMs by Rao et al. (2023) to a multilingual setup following their framework of probing LLMs with ethical dilemmas and policies from three branches of normative ethics: deontology, virtue, and consequentialism. We experiment with six languages: English, Spanish, Russian, Chinese, Hindi, and Swahili. We find that GPT-4 is the most consistent and unbiased ethical reasoner across languages, while ChatGPT and Llama2-70B-Chat show significant moral value bias when we move to languages other than English. Interestingly, the nature of this bias significantly vary across languages for all LLMs, including GPT-4.

研究の動機と目的

  • 言語モデルの倫理的推論および道徳的価値の整合性が、プロンプトに使用される言語に影響を受けるかどうかを検討すること。
  • 多言語、特に低リソース言語を含む状況下で、言語モデルが示す道徳バイアスの程度を評価すること。
  • 言語モデルが人間と同様に「外国語効果(Foreign Language Effect)」を示すかどうか、つまり、ジレンマが母国語でない言語で提示された際に道徳的判断が変化するかどうかを評価すること。
  • GPT-4、ChatGPT、Llama2-70B-Chatという3つの代表的言語モデルを、多様な言語的・文化的文脈において比較すること。
  • 言語モデルの倫理的推論が言語間で一貫しているかどうか、特に低リソース言語においてはその整合性が損なわれるかどうかを特定すること。

提案手法

  • Raoら(2023)の倫理的推論フレームワークを改変し、デオントロジー、バーチュース・エティクス、結果主義の3つの規範的倫理理論に基づく標準化された道徳ジレンマを用いた。
  • 各道徳的方針について、3段階の抽象度レベルを持つプロンプトを構築し、言語的・文化的な違いにわたる推論の一貫性をテストした。
  • GPT-4、ChatGPT(2023年9月版)、Llama2-70B-Chatの3つの言語モデルを、英語、スペイン語、ロシア語、中国語、ヒンディ語、スワヒリ語の6言語で評価した。
  • 言語モデルの出力を収集し、提示された道徳的方針との整合性に基づいて分類し、一貫性とバイアスを測定した。
  • バイアスは、方針に整合した出力からの逸脱として定量化され、逸脱度が高いほど言語固有の道徳バイアスが強いことを示した。
  • 妥当な分類のため、人間によるアノテート済みの真値(ground truth)を用いて検証を行い、倫理的推論結果の分類の信頼性を確保した。
(a) ChatGPT bias
(a) ChatGPT bias

実験結果

リサーチクエスチョン

  • RQ1LLMのプロンプトに使用される言語が、その倫理的推論および道徳的価値の整合性に影響を与えるか?
  • RQ2GPT-4、ChatGPT、Llama2-70B-ChatといったLLMが、英語以外の言語で推論を行う際、どの程度の道徳バイアスを示すか?
  • RQ3LLMは、ジレンマが母国語でない言語で提示された際に道徳的判断が変化する「外国語効果」を示すか?
  • RQ4ヒンディ語やスワヒリ語といった高リソース言語と低リソース言語において、倫理的推論のパフォーマンスはどのように変化するか?
  • RQ5バイアスのパターンはモデルや言語全体で一貫しているのか、それともジレンマ固有で、モデル依存的なのか?

主な発見

  • GPT-4は、全6言語において最も一貫性があり、バイアスが最小限の倫理的推論を示し、提示された道徳的方針との強い整合性を維持した。
  • ChatGPTおよびLlama2-70B-Chatは、英語以外の言語において顕著な道徳的価値バイアスを示し、特にヒンディ語およびスワヒリ語で最も高いバイアスが観察された。
  • ヒンディ語およびスワヒリ語で倫理的推論のパフォーマンスが最も低く、英語およびロシア語で最も高かった。これは、言語リソースの可用性と推論品質の間に相関があることを示している。
  • バイアスの性質は、言語やモデルによって顕著に異なるため、言語固有の文化的・言語的ニュアンスがLLMの行動に強く影響していることが示唆された。
  • 英語とスペイン語、ヒンディ語と中国語の間で、モデル全体を通して類似したバイアスパターンが観察された。これは、モデル行動に言語的または文化的クラスタリングが存在する可能性を示唆している。
  • 本研究は、LLMが道徳的価値に普遍的に整合しているのではなく、プロンプトの言語的・文化的文脈に敏感であることを確認した。これにより、多言語的倫理的整合性を仮定する考え方は揺るがされた。
(b) ChatGPT confusion
(b) ChatGPT confusion

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。