Skip to main content
QUICK REVIEW

[論文レビュー] Ethical Reasoning over Moral Alignment: A Case and Framework for In-Context Ethical Policies in LLMs

Abhinav Rao, Aditi Khandelwal|arXiv (Cornell University)|Oct 11, 2023
Legal Education and Practice InnovationsSocial Sciences被引用数 3
ひとこと要約

本稿では、LLMのトレーニングから倫理的価値の整合性を分離し、道徳的原則をハードコードするのではなく、汎用的な倫理的推論能力をモデルに与えることで、その実現を提案している。道徳的ジレンマと多様な倫理的理論(義務論、徳目論、結果主義)からの政策を、さまざまな抽象度で統合したフレームワークを導入し、文脈内での倫理的意思決定を可能にしている。GPT-4はほぼ完璧な推論を示したが、すべてのモデルが西洋的・個人主義的価値に対して強いバイアスを示しており、伝統的またはコミュニティベースの倫理とは対照的である。

ABSTRACT

In this position paper, we argue that instead of morally aligning LLMs to specific set of ethical principles, we should infuse generic ethical reasoning capabilities into them so that they can handle value pluralism at a global scale. When provided with an ethical policy, an LLM should be capable of making decisions that are ethically consistent to the policy. We develop a framework that integrates moral dilemmas with moral principles pertaining to different foramlisms of normative ethics, and at different levels of abstractions. Initial experiments with GPT-x models shows that while GPT-4 is a nearly perfect ethical reasoner, the models still have bias towards the moral values of Western and English speaking societies.

研究の動機と目的

  • LLMにおける事前の価値整合性を批判し、代わりに汎用的な倫理的推論を提唱すること。
  • 倫理的AIにおける価値多様性に対処し、ユーザーが提供する方針に基づいてLLMが倫理的に推論できるようにすること。
  • プロンプトにおける倫理的方針の指定と評価を体系的に行うフレームワークを開発すること。
  • 現在のLLMに見られる文化的および価値ベースのバイアス、特にグローバルサウスやイスラム文化の価値に対してのバイアスを特定・定量すること。
  • アプリケーションレベルで文脈に応じてカスタマイズ可能であり、モデルにハードコードされていない倫理的意思決定を可能にすること。

提案手法

  • 人間関係、職業、社会的、文化的価値の対立を反映する12の道徳的ジレンマを設計する。
  • 義務論、徳目論、結果主義といった規範的倫理理論に基づく、複数の抽象度での倫理的方針を定義する。
  • これらのジレンマと方針を文脈内プロンプトに統合し、異なる道徳的立場に基づくLLMの倫理的推論能力を評価する。
  • GPT-xシリーズ(GPT-4を含む)のモデルを用いて、多様な倫理的シナリオにおける推論パフォーマンスをテストする。
  • モデル出力を、指定された方針と整合しているかを分析し、価値選好におけるバイアスを検出する。
  • イングルハート=ウェルツ文化地図を用いて、文化的価値次元(例:個人主義対伝統主義)ごとにモデル行動を評価する。
Figure 1: Aspects of an AI system that affects the definition, operationalization and implementation of ethical policies.
Figure 1: Aspects of an AI system that affects the definition, operationalization and implementation of ethical policies.

実験結果

リサーチクエスチョン

  • RQ1LLMは、事前の価値整合性ではなく、文脈内での方針指定によって効果的に倫理的推論を実行できるか?
  • RQ2異なるLLMは、さまざまな倫理的方針が提示された場合に、どのように道徳的ジレンマを解決するか?
  • RQ3現在のLLMは、西洋的・英語圏の規範を特に好むなど、文化的および価値ベースのバイアスをどの程度示しているか?
  • RQ4モデルサイズは、複雑な道徳的シナリオにおける倫理的推論能力とどの程度相関しているか?
  • RQ5汎用的かつ拡張可能なフレームワークは、統一的なプロンプト手法で多様な倫理的理論と方針の抽象度をサポートできるか?

主な発見

  • GPT-4は明確な倫理的方針が提示された場合、ほぼ完璧な倫理的推論を示し、意図された道徳的立場と高い一貫性を示した。
  • GPT-3 や ChatGPT などの小規模モデルは、西洋文化に共通する個人主義的・自己表現的・民主的価値に対して顕著なバイアスを示した。
  • テストされたすべてのモデル、GPT-4を含む、西洋的・英語圏の文化的価値に対して強い好みを示しており、伝統的・コミュニティベースの価値や生存志向の価値とは対照的である。
  • モデルは、宗教的またはコミュニティの伝統を含むジレンマにおいて、文化的な規範を尊重するのをしばしば失敗しており、たとえばヒンズー教のベジタリアニズムの規則を「任意」と誤解して表現することが多い。
  • 倫理的推論パフォーマンスはモデルスケールに伴い向上するが、最先端モデルですらバイアスが持続する。
  • フレームワークは、現在のLLMが文化的に中立ではなく、倫理的推論がプロンプトに埋め込まれた道徳的価値に極めて敏感であることを明確に示した。
Figure 2: Heatmap of Bias of the Models across different dilemmas
Figure 2: Heatmap of Bias of the Models across different dilemmas

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。