Skip to main content
QUICK REVIEW

[论文解读] A computational framework for human values

Nardine Osman, Mark d’Inverno|arXiv (Cornell University)|May 4, 2023
Psychology of Moral and Emotional Judgment被引用 4
一句话总结

本文提出了一种基于社会科学研究所建立的正式计算框架,用于描述人类价值观,使人工智能系统能够通过结构化的价值观分类体系来表示、推理并实现与人类价值观的一致性。该框架支持动态价值观建模、价值观对齐度量,并可与多智能体系统集成,为伦理人工智能设计提供一个可证明与人类价值观对齐的基础模型。

ABSTRACT

In the diverse array of work investigating the nature of human values from psychology, philosophy and social sciences, there is a clear consensus that values guide behaviour. More recently, a recognition that values provide a means to engineer ethical AI has emerged. Indeed, Stuart Russell proposed shifting AI's focus away from simply ``intelligence'' towards intelligence ``provably aligned with human values''. This challenge -- the value alignment problem -- with others including an AI's learning of human values, aggregating individual values to groups, and designing computational mechanisms to reason over values, has energised a sustained research effort. Despite this, no formal, computational definition of values has yet been proposed. We address this through a formal conceptual framework rooted in the social sciences, that provides a foundation for the systematic, integrated and interdisciplinary investigation into how human values can support designing ethical AI.

研究动机与目标

  • 解决人工智能研究中缺乏人类价值观的正式计算定义的问题。
  • 为建模人类价值观提供统一的、跨学科的基础,以支持伦理人工智能的发展。
  • 实现对个人和群体价值观的系统性推理,包括随时间推移的动态变化。
  • 形式化价值观对齐问题,使人工智能行为与人类价值观之间的对齐可被证明。
  • 支持为价值观感知的人工智能系统设计数据结构和算法。

提出的方法

  • 提出一种使用抽象概念(标签)、属性节点表示意义,以及重要性权重来表示价值观一致性和层次结构的形式化价值观分类体系。
  • 基于行为与选定价值观之间的一致性程度,提出一种基于归一化相似性度量的计算模型,用于衡量价值观对齐。
  • 通过混合多智能体系统建模个人和群体价值观,将人工智能代理与人类代理整合到组织或社区环境中。
  • 引入情境评估以建模动态的价值演化,使代理能够根据情境背景重新评估其价值观。
  • 使用一个持续示例来展示实现选择,说明价值观表示、对齐计算以及情境依赖的推理。
  • 采用形式化语言以确保精确性,支持算法开发,并实现基于证明的推理。

实验结果

研究问题

  • RQ1如何以一种支持人工智能计算推理的方式,正式定义和表示人类价值观?
  • RQ2哪些机制能够实现个人和群体价值观随时间推移的动态建模?
  • RQ3如何正式衡量和量化人工智能行为与人类价值观之间的价值观对齐?
  • RQ4聚合个体和群体价值观的计算与表示需求是什么?
  • RQ5如何从人类利益相关者处构建并学习价值观分类体系,包括显式和隐式方式?

主要发现

  • 所提出的框架提供了一个正式且计算上可处理的人类价值观模型,整合了社会科学研究所涵盖的核心原则,包括价值观一致性与重要性加权。
  • 价值观对齐被正式定义为观测行为与选定价值观之间的归一化相似性度量,在持续示例中计算得分为0.475。
  • 通过情境敏感的评估,该模型支持动态价值观推理,使代理能够随时间适应其基于价值观的决策。
  • 该框架支持为价值观对齐与聚合开发系统性算法,为可证明对齐的人工智能系统提供基础。
  • 该方法可扩展至多智能体系统,并支持从人类利益相关者处获取显式和隐式价值观。
  • 该模型的设计允许与现有多智能体系统(MAS)概念集成,同时保持理论清晰性与实现灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。