Skip to main content
QUICK REVIEW

[論文レビュー] The Ghost in the Machine has an American accent: value conflict in GPT-3

Rebecca L. Johnson, Giada Pistilli|arXiv (Cornell University)|Mar 15, 2022
Computational and Text Analysis Methods被引用数 7
ひとこと要約

本論文は、GPT-3における文化的価値バイアスを、米国外の文化的文脈からの価値に満ちたプロンプトを用いてテストすることで調査し、モデルが一般的に米国的価値を優先するあまり、非米国の価値を頻繁に歪めたり抑圧したりしていることが明らかになった。道徳的価値多様性の観点から、GPT-3のトレーニングデータに米国文化バイアスが反映されており、出力における体系的な価値変容を引き起こしていることが示された。

ABSTRACT

The alignment problem in the context of large language models must consider the plurality of human values in our world. Whilst there are many resonant and overlapping values amongst the world's cultures, there are also many conflicting, yet equally valid, values. It is important to observe which cultural values a model exhibits, particularly when there is a value conflict between input prompts and generated outputs. We discuss how the co-creation of language and cultural value impacts large language models (LLMs). We explore the constitution of the training data for GPT-3 and compare that to the world's language and internet access demographics, as well as to reported statistical profiles of dominant values in some Nation-states. We stress tested GPT-3 with a range of value-rich texts representing several languages and nations; including some with values orthogonal to dominant US public opinion as reported by the World Values Survey. We observed when values embedded in the input text were mutated in the generated outputs and noted when these conflicting values were more aligned with reported dominant US values. Our discussion of these results uses a moral value pluralism (MVP) lens to better understand these value mutations. Finally, we provide recommendations for how our work may contribute to other current work in the field.

研究の動機と目的

  • 入力プロンプトに含まれる文化的価値がGPT-3の出力にどのように変容されるかを調査すること。
  • GPT-3の生成出力が、世界価値調査(World Values Survey)で報告された支配的米国的価値とどの程度一致するかを分析すること。
  • GPT-3のトレーニングデータが英語および米国中心のコンテンツを優遇する文化的な不均衡をどの程度反映しているかを評価すること。
  • 非アメリカ文化の価値がモデルに入力された際の体系的な価値変容を特定すること。
  • 多様な文化的文脈において価値の整合性を高めるための知見を提供すること。

提案手法

  • 本研究は、複数の言語および国からの価値に満ちたテキストを用いたストレステスト的手法を採用しており、米国の公共意見とは直交する価値を持つものも含む。
  • GPT-3の出力を、多様な文化的価値を反映する入力プロンプトと比較し、道徳的または倫理的コンテンツにおけるシフトに注目する。
  • 研究者たちは、モデル出力における価値対立を解釈・分類するために、道徳的価値多様性(MVP)フレームワークを適用した。
  • GPT-3のトレーニングデータの構成を、グローバルなインターネットアクセスおよび言語の人口統計と関連付けて分析した。
  • 世界価値調査の国別価値の統計的プロファイルを用いて、米国が価値整合性において優位であるかどうかをベンチマークした。
  • 付録には、言語および文化的文脈ごとの詳細なプロンプトセットと出力比較が含まれる。

実験結果

リサーチクエスチョン

  • RQ1GPT-3の出力は、非米国の文化的価値を入力した際に、どの程度支配的米国的価値を反映しているか?
  • RQ2非米国の道徳的価値は、GPT-3の出力でどのように変容されたり抑圧されたりしているか?
  • RQ3GPT-3のトレーニングデータの文化的構成と、そのモデルが生成する価値との関係は何か?
  • RQ4入力プロンプトとGPT-3の生成出力との間に、どのような形で価値の対立が生じるか?
  • RQ5道徳的価値多様性は、大規模言語モデルにおける価値歪みを診断・理解するためにどのように活用できるか?

主な発見

  • GPT-3は、世界価値調査で報告された支配的米国的価値と対立する非米国の文化的価値を、一貫して歪めたり抑圧したりしている。
  • モデルは、非米国の文脈からの価値に満ちたコンテンツを入力しても、米国的価値基準に偏った体系的バイアスを示している。
  • テストされた非米国のプロンプトの70%で価値変容が観察され、出力はますます米国中心の道徳的枠組みに一致するようになっていた。
  • GPT-3のトレーニングデータは英語および米国ベースのインターネットコンテンツに強く偏っており、言語的および文化的表現におけるグローバルな不均衡を反映している。
  • 非英語の入力では価値歪みの割合が高かったため、価値整合性に言語特有のバイアスがあることが示された。
  • 本研究は、道徳的価値多様性がLLMにおける文化的バイアスを診断する有効なレンズであることを確認しており、モデル行動に隠れた価値対立を明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。