Skip to main content
QUICK REVIEW

[论文解读] Free Energy and the Generalized Optimality Equations for Sequential Decision Making

Pedro A. Ortega, Daniel A. Braun|arXiv (Cornell University)|May 17, 2012
Decision-Making and Behavioral Economics参考文献 17被引用 8
一句话总结

本文提出了一种用于有限理性序列决策问题的统一自由能原理,推导出广义最优性方程,该方程涵盖贝尔曼方程以及标准决策规则(如期望最大值法、极小化最大值法和期望极小化最大值法)。通过为决策树中的每个节点分配一个资源参数(逆温度),该框架将计算成本量化为采样需求,为在随机与对抗性环境中资源受限条件下的理性行为提供了规范性基础。

ABSTRACT

The free energy functional has recently been proposed as a variational principle for bounded rational decision-making, since it instantiates a natural trade-off between utility gains and information processing costs that can be axiomatically derived. Here we apply the free energy principle to general decision trees that include both adversarial and stochastic environments. We derive generalized sequential optimality equations that not only include the Bellman optimality equations as a limit case, but also lead to well-known decision-rules such as Expectimax, Minimax and Expectiminimax. We show how these decision-rules can be derived from a single free energy principle that assigns a resource parameter to each node in the decision tree. These resource parameters express a concrete computational cost that can be measured as the amount of samples that are needed from the distribution that belongs to each node. The free energy principle therefore provides the normative basis for generalized optimality equations that account for both adversarial and stochastic environments.

研究动机与目标

  • 开发一种用于序列决策问题中有限理性决策的规范性框架,同时考虑效用最大化与计算成本。
  • 通过单一变分原理,将贝尔曼最优性方程推广至包含对抗性与随机环境的情形。
  • 将已知的决策规则——期望最大值法、极小化最大值法与期望极小化最大值法——作为统一自由能泛函的特例推导出来。
  • 为每个节点分布所需的采样数量提供具体且可度量的计算成本解释。
  • 在决策树中建立信息处理成本与决策性能之间的原则性联系。

提出的方法

  • 将决策行为形式化为自由能最小化问题,其中均衡分布 P 通过先验 Q 和效用 U 经由类似玻尔兹曼的变换得到,其中包含逆温度 α。
  • 在每个决策节点引入资源参数 β(x),代表逆温度 α,用于量化信息处理的成本。
  • 通过在决策序列上递归最大化自由能泛函,推导出广义最优性方程,同时纳入奖励与信息成本。
  • 利用伸缩求和与递归分解,将轨迹的总自由能表示为时间步长的总和,从而支持动态规划求解。
  • 应用变分法推导每个节点的最优策略,表明最优策略是动作上的吉布斯分布,其权重由效用与信息成本决定。
  • 证明在极限情况下,自由能泛函退化为已知的决策规则:当 α→∞ 时对应最大化(如期望最大值法),当 α→0 时对应极小化最大值法,而混合 α 值则对应期望极小化最大值法。

实验结果

研究问题

  • RQ1能否通过单一变分原理,统一有限理性在随机与对抗性环境下的决策行为?
  • RQ2如何在序列决策模型中正式且定量地整合计算成本?
  • RQ3标准决策规则(如极小化最大值法与期望极小化最大值法)能否作为广义最优性方程的特例推导出来?
  • RQ4逆温度参数 α 与近似决策所需采样数量之间存在何种关系?
  • RQ5自由能泛函如何将贝尔曼最优性方程推广至包含信息处理约束的情形?

主要发现

  • 自由能泛函为有限理性下的决策行为提供了规范性基础,平衡了效用增益与信息处理成本。
  • 在计算资源无限(α→∞)的极限下,广义最优性方程退化为标准贝尔曼方程。
  • 当 α→0 时,极小化最大值法作为自由能原理的极限情况出现,对应最坏情况下的优化。
  • 当决策树中同时包含期望与最小化节点,并赋予适当的资源参数时,期望极小化最大值法可作为特例推导出来。
  • 每个节点的计算成本被量化为从该节点分布中采样的数量,其上下界以效用差距与先验概率表示。
  • 该框架支持通过动态规划递归求解决策问题,最优策略由依赖于局部奖励与信息成本的吉布斯分布给出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。