Skip to main content
QUICK REVIEW

[論文レビュー] Moral Mimicry: Large Language Models Produce Moral Rationalizations Tailored to Political Identity

Gabriel Simmons|arXiv (Cornell University)|Sep 24, 2022
Computational and Text Analysis Methods被引用数 11
ひとこと要約

本研究では、大規模言語モデル(LLMs)が、モーラルフォーティス・セオリー(Moral Foundations Theory)を用いて、リベラルまたはコンservativeな政治的アイデンティティに一致する道徳的正当化を生成する能力、すなわち「道徳的模倣(moral mimicry)」を示すかどうかを調査している。結果として、LLMsは政治的アイデンティティに一致する道徳的バイアスを再現しており、モデルが大きいほど模倣の傾向が強くなることが判明した。これは、AI生成コンテンツにおいてイ-deオロギカルな極端化を助長するリスクを示している。

ABSTRACT

Large Language Models (LLMs) have demonstrated impressive capabilities in generating fluent text, as well as tendencies to reproduce undesirable social biases. This study investigates whether LLMs reproduce the moral biases associated with political groups in the United States, an instance of a broader capability herein termed moral mimicry. This hypothesis is explored in the GPT-3/3.5 and OPT families of Transformer-based LLMs. Using tools from Moral Foundations Theory, it is shown that these LLMs are indeed moral mimics. When prompted with a liberal or conservative political identity, the models generate text reflecting corresponding moral biases. This study also explores the relationship between moral mimicry and model size, and similarity between human and LLM moral word use.

研究の動機と目的

  • 大規模言語モデル(LLMs)が、政治的アイデンティティに関連する道徳的バイアスを再現するかどうか、いわゆる「道徳的模倣(moral mimicry)」という現象を調査すること。
  • モデルサイズがLLMsにおける道徳的模倣の程度に与える影響を検討すること。
  • LLMsが生成する道徳的基盤の使用法と、人間のコンセンサスおよび個人の人の道徳的言語使用法を比較すること。
  • LLMsがシナリオおよびアイデンティティのプロンプトに基づいて文脈的に適切な道徳的正当化を生成できるかどうかを評価すること。

提案手法

  • 標準化されたテンプレートを用いて、シナリオ、政治的アイデンティティの表現、道徳的立場を組み合わせたプロンプトを構築した。
  • 生成されたテキストの分析に、モーラルフォーティス・セオリー(Moral Foundations Theory, MFT)を用い、5つの基盤(ケア/害、公平/不正、忠誠/裏切り、権威/破壊、聖域/劣化)に注目した。
  • MFTの辞書を適用して、LLMsの出力における道徳的基盤の使用頻度を定量化した。
  • 「リベラル」と「コンservative」のアイデンティティに応じたモデル出力を比較し、道徳的基盤使用の差を測定した。
  • モデルサイズ(例:GPT-3、GPT-3.5、OPT)と道徳的模倣の強さとの関係を評価した。
  • 効果量と統計的比較を用いて、人間とLLMsの道徳的語彙使用の類似度を測定した。

実験結果

リサーチクエスチョン

  • RQ1LLMsは、リベラルまたはコンservativeな政治的アイデンティティに関連する道徳的基盤を反映した道徳的正当化を生成するか?
  • RQ2モデルサイズは、LLMsにおける道徳的模倣の程度にどのように影響するか?
  • RQ3LLMsが生成する道徳的基盤の使用法は、人間のコンセンサスおよび個人の人間の使用法とどれほど類似しているか?
  • RQ4LLMsは、状況に応じた道徳的シナリオに応じて、道徳的基盤の使用法を変更するか?

主な発見

  • LLMsは、プロンプトに提示された政治的アイデンティティ(リベラルまたはコンservative)に一致する道徳的基盤の使用を示すテキストを生成しており、道徳的模倣が確認された。
  • 道徳的模倣の程度はモデルサイズに応じて増加しており、特にOPTファミリーおよびGPT-3/3.5モデルにおいて顕著である。
  • より大きなモデルは、より小さなモデルと比較して、政治的アイデンティティに関連する人間の道徳的バイアスに強く一致する。
  • LLMsは、状況の文脈に応じて道徳的基盤の使用を変更し、状況に適した内容にすることが可能であるが、人間のコンセンサスとは完全には同一視できない。
  • LLMsが生成する道徳的言語は、人間のコンセンサスの基盤使用と、個人の人の違いよりも顕著に異なるため、模倣が完全ではないことが示唆された。
  • 道徳的模倣は、GPT-3/3.5およびOPTの複数のLLMファミリーで観察されたため、最先端モデルにおいて一般化可能な能力であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。