Skip to main content
QUICK REVIEW

[論文レビュー] A computational framework for human values

Nardine Osman, Mark d’Inverno|arXiv (Cornell University)|May 4, 2023
Psychology of Moral and Emotional Judgment被引用数 4
ひとこと要約

本稿は、社会科研究の知見に基づき、人間の価値を形式的で計算可能な枠組みとして提示し、AIシステムが体系的な価値分類を用いて、人間の価値を表現・推論・適合させることを可能にする。この枠組みは動的価値モデリング、価値適合の測定を支援し、マルチエージェントシステムと統合可能であり、人間の価値に証明可能に適合するよう設計された、倫理的AI設計の基盤的モデルを提供する。

ABSTRACT

In the diverse array of work investigating the nature of human values from psychology, philosophy and social sciences, there is a clear consensus that values guide behaviour. More recently, a recognition that values provide a means to engineer ethical AI has emerged. Indeed, Stuart Russell proposed shifting AI's focus away from simply ``intelligence'' towards intelligence ``provably aligned with human values''. This challenge -- the value alignment problem -- with others including an AI's learning of human values, aggregating individual values to groups, and designing computational mechanisms to reason over values, has energised a sustained research effort. Despite this, no formal, computational definition of values has yet been proposed. We address this through a formal conceptual framework rooted in the social sciences, that provides a foundation for the systematic, integrated and interdisciplinary investigation into how human values can support designing ethical AI.

研究の動機と目的

  • AI研究における人間の価値の形式的・計算的定義の欠如に取り組むこと。
  • 人間の価値をモデリングするための統一的で多様な分野の基盤を提供し、倫理的AI開発を支援すること。
  • 個人および集団の価値、特に時間の経過に伴う変化を含めた、体系的な推論を可能にすること。
  • 価値適合問題を形式的に定式化し、AI行動と人間の価値との間で証明可能な適合性を可能にすること。
  • 価値に配慮したAIシステムのためのデータ構造およびアルゴリズムの設計を支援すること。

提案手法

  • 抽象的概念(ラベル)を用いた形式的価値分類を提案し、意味を表すプロパティノードと重要度重みを用いて、価値の整合性と階層を表現する。
  • 選択された価値との行動の一貫性の度合いに基づき、正規化された類似度測度を用いた価値適合の計算モデルを導入する。
  • 人工的および人間エージェントを統合した組織的またはコミュニティ的環境において、個人および集団の価値をハイブリッドマルチエージェントシステムを通じてモデリングする。
  • 文脈的評価を組み込み、エージェントが状況的文脈に基づいて価値を再評価することで、動的価値進化をモデル化する。
  • 実装上の選択肢を示すために、走りの例を用い、価値表現、適合計算、文脈依存的推論を説明する。
  • 正確性を保証し、アルゴリズム開発を支援し、価値に関する証明に基づく推論を可能にするため、形式的言語を採用する。

実験結果

リサーチクエスチョン

  • RQ1人間の価値は、AIにおける計算的推論を支援する形で、どのように形式的に定義・表現できるか?
  • RQ2個人および集団の価値を時間の経過に伴い動的にモデリングするためのメカニズムは何か?
  • RQ3AI行動と人間の価値との間の価値適合は、どのように形式的に測定・定量化できるか?
  • RQ4個人および集団の価値を集約するための計算的および表現的要件は何か?
  • RQ5人間のステークホルダーから、明示的および暗黙的の両方の方法で、価値分類を構築し学習するにはどうすればよいか?

主な発見

  • 提案された枠組みは、価値の整合性と重要度重み付けといった社会科研究の核心的原則を統合し、人間の価値を形式的かつ計算的に扱えるモデルを提供する。
  • 価値適合は、観察された行動と選択された価値との間の正規化類似度測度として形式的に定義され、走りの例では0.475の値が得られた。
  • 文脈に依存する評価を通じて、動的価値推論が可能となり、エージェントが時間の経過に伴い価値に基づく意思決定を適応可能にする。
  • この枠組みは、価値適合および集約のための体系的アルゴリズム開発を可能にし、証明可能に適合したAIシステムの基盤を提供する。
  • このアプローチはマルチエージェントシステムへ拡張可能であり、人間のステークホルダーから明示的および暗黙的の両方で価値を取得可能である。
  • モデルの設計により、既存のマルチエージェントシステム(MAS)の概念と統合可能でありながら、理論的明確性と実装の柔軟性を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。