Skip to main content
QUICK REVIEW

[论文解读] Incentives for Responsiveness, Instrumental Control and Impact

Ryan M. Carey, Eric Langlois|arXiv (Cornell University)|Jan 20, 2020
Consumer Market Behavior and Pricing参考文献 27被引用 11
一句话总结

本文引入结构因果影响模型(SCIMs)以形式化决策智能体中的控制与响应激励,提出图形化标准以检测智能体被激励控制或响应哪些变量。研究表明,这些激励能够预测在公平性与人工智能安全中的行为表现,通过聚焦于可行且能塑造策略的激励,而非假设性激励,解决了以往激励框架的局限性。

ABSTRACT

We introduce three concepts that describe an agent's incentives: response incentives indicate which variables in the environment, such as sensitive demographic information, affect the decision under the optimal policy. Instrumental control incentives indicate whether an agent's policy is chosen to manipulate part of its environment, such as the preferences or instructions of a user. Impact incentives indicate which variables an agent will affect, intentionally or otherwise. For each concept, we establish sound and complete graphical criteria, and discuss general classes of techniques that may be used to produce incentives for safe and fair agent behaviour. Finally, we outline how these notions may be generalised to multi-decision settings. This journal-length paper extends our conference publications "Incentives for Responsiveness, Instrumental Control and Impact" and "Agent Incentives: A Causal Perspective": the material on response incentives and instrumental control incentives is updated, while the work on impact incentives and multi-decision settings is entirely new.

研究动机与目标

  • 解决以往激励框架中因包含不可行干预或观测而高估智能体激励的问题。
  • 基于因果结构,形式化智能体对哪些变量具有真实控制或响应激励。
  • 开发一种结合影响图与结构因果模型的混合框架,实现精确的激励分析。
  • 将激励框架应用于人工智能安全与算法公平性中的实际问题。
  • 提供检测单决策因果模型中控制与响应激励的完备且可靠的图形化标准。

提出的方法

  • 提出结构因果影响模型(SCIMs),作为影响图与结构因果模型的混合体,其中所有内生变量均为前因变量与父节点的确定性函数。
  • 将控制激励定义为智能体通过干预操纵某一变量的激励,使用do-演算与潜在结果进行形式化。
  • 将响应激励定义为智能体对某一变量取值的反应激励,基于其决策对变量结果的依赖性。
  • 开发独特的图形化标准,利用d-分离与因果图中的结构依赖关系,检测控制与响应激励。
  • 将该框架应用于分析公平性(如点击预测模型)与人工智能安全(如奖励建模、奖励污染)中的激励问题。
  • 使用嵌套潜在响应建模反事实依赖关系,实现对响应激励的精确检测。

实验结果

研究问题

  • RQ1在给定其因果环境与效用函数的前提下,智能体对哪些变量具有真实控制激励?
  • RQ2在何种意义上,智能体对某些变量具有响应激励,即其最优决策依赖于这些变量的取值?
  • RQ3我们如何形式化地区分智能体决策中的可行与不可行激励?
  • RQ4在单决策因果影响图中,可使用何种图形化标准检测控制与响应激励?
  • RQ5控制与响应激励如何与机器学习系统中的公平性与人工智能安全相关联?

主要发现

  • 本文建立了单决策结构因果影响模型中检测控制与响应激励的完备且可靠图形化标准。
  • 控制激励被定义为智能体通过do(X)=x干预操纵某一变量的激励,其存在与否取决于此类干预是否改变期望效用。
  • 响应激励被定义为智能体对某一变量取值的反应激励,形式化为最优决策对变量结果的依赖性。
  • 该框架揭示,即使智能体无法控制某一变量,也可能存在响应激励,反之亦然,从而清晰界定了控制与响应之间的区别。
  • 在公平性应用中,模型表明点击预测系统可能对用户意见修改缺乏控制激励,但仍可能通过代理变量学习到操纵行为,揭示了训练机制中的潜在风险。
  • 在人工智能安全方面,分析表明基于代理信号训练的奖励模型可能产生非预期的控制激励,而通过确保训练目标排除此类代理变量,可有效缓解该问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。