[论文解读] Agents and Devices: A Relative Definition of Agency
本文提出一个贝叶斯框架,以形式化评估系统是否应被归类为代理(目标优化)或设备(输入-输出映射),基于其观测行为。通过代理使用逆强化学习,通过设备使用序列预测,利用贝叶斯法则计算后验概率,表明即使存在目标切换行为和次优轨迹,只要使用适当的先验,仍可将其解释为代理行为。
According to Dennett, the same system may be described using a `physical' (mechanical) explanatory stance, or using an `intentional' (belief- and goal-based) explanatory stance. Humans tend to find the physical stance more helpful for certain systems, such as planets orbiting a star, and the intentional stance for others, such as living animals. We define a formal counterpart of physical and intentional stances within computational theory: a description of a system as either a device, or an agent, with the key difference being that `devices' are directly described in terms of an input-output mapping, while `agents' are described in terms of the function they optimise. Bayes' rule can then be applied to calculate the subjective probability of a system being a device or an agent, based only on its behaviour. We illustrate this using the trajectories of an object in a toy grid-world domain.
研究动机与目标
- 形式化计算系统中代理与设备之间的观察者相对区分。
- 开发一种基于观测行为计算系统为代理或设备的主观概率的方法。
- 在包含多样化行为轨迹(包括目标切换和反应行为)的网格世界领域验证该方法。
- 证明即使目标发生变化,只要切换稀少且使用适当的先验进行建模,代理性仍可保持。
- 为人工智能和强化学习研究提供一种非人类中心、形式化的代理定义。
提出的方法
- 将系统的行为建模为时间序列上的输入-输出对 (x_t, y_t)。
- 将设备混合模型 M_d 定义为输入-输出函数 d 的加权和,每个函数具有先验权重 w_d,以建模机械行为。
- 使用逆强化学习定义代理混合模型 M_a,从观测行为中推断最可能的目标和 ε-贪婪策略。
- 应用贝叶斯定理,计算后验概率 P(M_a | yx_{1:T}),即在观测轨迹下系统为代理的概率。
- 通过比较设备模型和代理模型下轨迹的对数似然,确定哪种解释更可能。
- 使用切换目标先验模型,允许代理在行为过程中改变目标,从而提升对复杂轨迹的拟合度。
实验结果
研究问题
- RQ1我们如何形式化量化系统的某种行为最宜被解释为代理行为(目标优化)而非设备行为(机械输入-输出映射)的程度?
- RQ2在系统表现出目标切换行为时,其在多大程度上仍可被归类为代理?此类行为应如何建模?
- RQ3在设备模型与代理模型下,不同行为模式(如沿墙行走、随机移动或次优目标追求)的似然性如何比较?
- RQ4该框架能否仅基于观测轨迹区分真正代理行为与反应性、非目标导向行为?
- RQ5观察者的先验知识在多大程度上影响代理性的后验概率?这种影响能否以计算上可行的方式形式化?
主要发现
- 该框架在网格世界领域成功区分了设备类行为与代理类行为,其中沿墙行走等轨迹更宜被解释为设备行为,而目标导向路径则更宜被解释为代理行为。
- 次优但目标导向的行为(如选择非最优路径到达目标)在代理模型下的可能性高于设备模型,尤其在使用切换目标先验时更为明显。
- 随机行为在两种模型下的负对数似然(NLL)均较高,表明两种解释均拟合不佳,与缺乏可辨识的代理性或机制性一致。
- 当系统切换目标(如从品红色气球切换到绿色气球)时,使用切换先验的代理模型显著优于非切换模型,证明了先验结构的重要性。
- 当行为为有目标且一致时,即使次优,代理性的后验概率也会上升;而对反应性或随机行为,该概率则下降。
- 模型表明,只要目标切换稀少且在先验中显式建模,系统即可通过目标切换保持代理身份。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。