[论文解读] Discovering Agents
本文提出了首个关于智能体的正式因果定义:即当系统预期其行为会对世界产生不同影响时,会调整自身行为的系统。该研究提出了一种因果发现算法,可从经验数据中识别智能体,实现结构因果模型与博弈论影响图之间的转换,从而实现对目标导向型AI系统的严格安全分析。
Causal models of agents have been used to analyse the safety aspects of machine learning systems. But identifying agents is non-trivial -- often the causal model is just assumed by the modeler without much justification -- and modelling failures can lead to mistakes in the safety analysis. This paper proposes the first formal causal definition of agents -- roughly that agents are systems that would adapt their policy if their actions influenced the world in a different way. From this we derive the first causal discovery algorithm for discovering agents from empirical data, and give algorithms for translating between causal models and game-theoretic influence diagrams. We demonstrate our approach by resolving some previous confusions caused by incorrect causal modelling of agents.
研究动机与目标
- 为解决在机器学习系统中,特别是在安全关键场景下,缺乏识别智能体的正式标准的问题。
- 解决以往对智能体的因果建模中存在的模糊性,这些模糊性曾导致错误的安全分析。
- 开发一种基于因果发现的方法,从数据中实证识别智能体,而非预先假设其为智能体。
- 通过响应环境影响变化的因果机制,形式化智能体的概念。
- 利用实验干预实现智能体激励与决策规则的自动化推断。
提出的方法
- 提出具有显式机制节点(代表决策规则与环境参数)的机制化结构因果模型(SCM)。
- 开发一种算法,从干预分布中推断机制化因果图,实现智能体的因果发现。
- 提出一种机制化SCM与博弈论影响图之间的转换算法,建立因果与博弈论表示之间的联系。
- 通过基于干预的实验,测试系统在因果关系改变时是否会改变其行为,通过行为对反事实世界模型的敏感性来定义智能体。
- 应用独立因果机制(ICM)原则,识别当涉及智能体决策规则时的违反情况,从而将ICM的应用范围限制在非智能体系统中。
- 对奶酪位置和打滑概率等变量施加软干预,以模拟因果结构的变化,并评估智能体的响应能力。
实验结果
研究问题
- RQ1如何以因果术语正式定义智能体,使其能捕捉‘当智能体预期其行为会产生不同因果结果时,会调整自身行为’的直觉?
- RQ2可采用何种实验程序,从经验数据中发现智能体,而无需事先假设其为智能体?
- RQ3如何在因果模型与博弈论表示之间实现转换,以支持目标导向系统安全分析?
- RQ4标准因果发现方法(如ICM)在应用于包含智能体的系统时,会以何种方式失效?
- RQ5能否通过基于干预的因果发现方法,验证或修正先前假设,从而解决过去在智能体建模中的混淆?
主要发现
- 本文建立了智能体的正式因果定义:即如果系统预期其行为会对世界产生不同影响,则其行为会发生改变,该定义基于反事实推理。
- 所提出的因果发现算法成功识别出智能体,通过检测在干预因果机制(如改变老鼠实验中奶酪位置或打滑概率)下的行为适应性。
- 该方法通过区分偶然最优系统(如一块阻挡管道的岩石)与真正具有智能体特性的系统,解决了以往智能体建模中的混淆。
- 该方法揭示,独立因果机制(ICM)原则不适用于智能体决策规则或具有战略意义的变量,从而将ICM的适用范围限制在非智能体系统中。
- 机制化SCM与博弈图之间的转换算法,使我们能够通过因果数据系统推导激励结构,从而实现对AI系统的系统性安全分析。
- 在模拟环境(如网格世界老鼠示例)中的实证验证表明,该方法能正确识别出对因果变化敏感的智能体。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。