Skip to main content
QUICK REVIEW

[論文レビュー] Do Moral Judgment and Reasoning Capability of LLMs Change with Language? A Study using the Multilingual Defining Issues Test

Aditi Khandelwal, Utkarsh Agarwal|arXiv (Cornell University)|Feb 3, 2024
Corporate Finance and GovernanceBusiness, Management and Accounting被引用数 3
ひとこと要約

本研究は、英語、スペイン語、ロシア語、中国語、ヒンディー語、スワヒリ語の6言語を対象に、多言語版Defining Issues Test(DIT)を用いて、大規模言語モデル(LLMs)の道徳的判断および道徳的推論能力を評価した。その結果、GPT-4は全言語で一貫した後期的道徳的推論を示したが、ヒンディー語およびスワヒリ語ではLlama2Chat-70BおよびChatGPTの性能が顕著に低く、訓練データおよび言語的要因に起因する言語依存的変動が道徳的推論能力に影響していることが示された。

ABSTRACT

This paper explores the moral judgment and moral reasoning abilities exhibited by Large Language Models (LLMs) across languages through the Defining Issues Test. It is a well known fact that moral judgment depends on the language in which the question is asked. We extend the work of beyond English, to 5 new languages (Chinese, Hindi, Russian, Spanish and Swahili), and probe three LLMs -- ChatGPT, GPT-4 and Llama2Chat-70B -- that shows substantial multilingual text processing and generation abilities. Our study shows that the moral reasoning ability for all models, as indicated by the post-conventional score, is substantially inferior for Hindi and Swahili, compared to Spanish, Russian, Chinese and English, while there is no clear trend for the performance of the latter four languages. The moral judgments too vary considerably by the language.

研究の動機と目的

  • LLMsの道徳的判断および道徳的推論能力が、異なる言語によって変動するかどうかを調査すること。
  • 従来の英語限定のLLM道徳的推論研究を、Defining Issues Test(DIT)を用いて多言語環境に拡張すること。
  • 言語固有の訓練データおよび言語的多様性が、LLMsの道徳的推論パフォーマンスに与える影響を評価すること。
  • 訓練データにおける文化的および言語的差が、道徳的ジレンマにおけるモデル行動に与える影響を検討すること。
  • 今後のクロスリンガル道徳的推論研究のため、多言語DITデータセットを構築し、公開すること。

提案手法

  • Google Translateを用いて、元のDIT道徳的ジレンマをスペイン語、ロシア語、中国語、ヒンディー語、スワヒリ語の5言語に翻訳し、手動による検証を実施した。
  • GPT-4、ChatGPT、Llama2Chat-70Bの3つのLLMsに、各ジレンマを解決し、上位4つの道徳的考慮事項を順位付けさせるプロンプトを提示した。
  • DITフレームワークに基づき、後期的、常識的、前段階的推論を反映する道徳的発達段階スコア(Pスコア)を算出した。
  • 言語間でのPスコアの差を検出するために、統計的有意性検定(Mann-Whitney U検定)を実施した。
  • Kohlbergの認知的道徳発達(CMD)理論に整合するかを分析し、推論を段階に分類した。
  • ジレンマおよび言語間での道徳的判断および推論の一貫性を評価し、パターンおよび異常を同定した。
(a) ChatGPT
(a) ChatGPT

実験結果

リサーチクエスチョン

  • RQ1LLMsの道徳的推論能力は、異なる言語間で顕著に変動するか?
  • RQ2GPT-4、ChatGPT、Llama2Chat-70Bは、多言語環境下で道徳的推論パフォーマンスにおいてどのように比較されるか?
  • RQ3ヒンディー語やスワヒリ語のような低リソース言語において、道徳的判断に顕著な差が生じるか?
  • RQ4訓練データおよび言語的多様性が、LLMsの道徳的推論を言語ごとにどのように形作るか?
  • RQ5訓練データに含まれる文化的および言語的要因が、LLMsの道徳的意思決定にどの程度影響を与えるか?

主な発見

  • GPT-4は、全6言語で最も一貫した後期的道徳的推論を示し、Pスコアの変動が最小であった。
  • Llama2Chat-70BおよびChatGPTでは、ヒンディー語およびスワヒリ語における道徳的推論パフォーマンスが、英語、スペイン語、ロシア語、中国語に比べ顕著に低かった。
  • 道徳的判断の一致度は、英語、中国語、スペイン語で最も高く、英語とロシア語は類似したPスコアを示したが、顕著な差が認められた。
  • ヘイズのジレンマでは、言語間でPスコアに最も統計的に有意な差が認められ、次いで新聞のジレンマが続いた。
  • ウェブスターのジレンマおよび囚人のジレンマでは、どのモデルに対しても言語間でPスコアの有意差は認められなかった。
  • ヒンディー語では、ChatGPTおよびLlama2Chat-70Bのパフォーマンスはランダムベースラインと同等に留まり、深刻な推論の劣化が示された。
(b) Llama2Chat-70B
(b) Llama2Chat-70B

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。