Skip to main content
QUICK REVIEW

[论文解读] Transfer-Entropy-Regularized Markov Decision Processes

Takashi Tanaka, Henrik Sandberg|arXiv (Cornell University)|Aug 30, 2017
Advanced Thermodynamics and Statistical Mechanics参考文献 52被引用 4
一句话总结

本文提出了一种基于传递熵正则化的马尔可夫决策过程(TERMDP),通过在经典的状态相关代价与状态到动作的信息流之间进行权衡,实现优化。该研究开发了一种受Arimoto-Blahut算法启发的迭代前向-后向算法,可收敛至非凸TERMDP的驻点,从而在控制与热力学系统的信息约束下实现最优策略设计。

ABSTRACT

We consider the framework of transfer-entropy-regularized Markov Decision Process (TERMDP) in which the weighted sum of the classical state-dependent cost and the transfer entropy from the state random process to the control random process is minimized. Although TERMDPs are generally formulated as nonconvex optimization problems, we derive an analytical necessary optimality condition expressed as a finite set of nonlinear equations, based on which an iterative forward-backward computational procedure similar to the Arimoto-Blahut algorithm is proposed. It is shown that every limit point of the sequence generated by the proposed algorithm is a stationary point of the TERMDP. Applications of TERMDPs are discussed in the context of networked control systems theory and non-equilibrium thermodynamics. The proposed algorithm is applied to an information-constrained maze navigation problem, whereby we study how the price of information qualitatively alters the optimal decision polices.

研究动机与目标

  • 将一种新颖的最优控制框架形式化,通过使用传递熵惩罚状态到动作的信息流。
  • 为TERMDP推导出必要最优性条件,表示为一组有限的非线性方程。
  • 开发一种计算高效的迭代算法以求解TERMDP,并提供收敛至驻点的保证。
  • 展示该框架在联网控制系统与非平衡热力学中的适用性。
  • 阐明信息成本如何改变受限环境(如迷宫导航)中最优决策策略的结构。

提出的方法

  • 将TERMDP建模为一个非凸优化问题,目标是最小化状态相关代价与状态到控制过程的传递熵之和。
  • 推导出一个涉及条件概率与拉格朗日乘子的非线性方程组,作为必要最优性条件。
  • 提出一种类似于Arimoto-Blahut算法的前向-后向迭代算法,通过交替更新控制策略与对偶变量。
  • 引入一个投影算子 π,将一般策略映射到具有有限记忆的受限策略类中,在特定条件下保持最优性。
  • 通过证明算法序列的每个极限点都是TERMDP的驻点,建立收敛性。
  • 在信息受限的迷宫导航任务上验证该算法,研究不同信息成本下策略的演变。

实验结果

研究问题

  • RQ1如何将对状态到动作信息流的信息论约束整合到马尔可夫决策过程中,以建模实际中传感与通信受限的决策行为?
  • RQ2TERMDP中的最优策略具有何种分析特征?尽管问题具有非凸性,如何实现其数值求解?
  • RQ3信息成本如何影响受限环境中最优控制策略的结构与性能?
  • RQ4所提出的算法能否可靠地计算TERMDP的驻点?其收敛性保证为何?
  • RQ5TERMDP在多大程度上能够捕捉联网控制系统与非平衡热力学中的基本性能极限?

主要发现

  • 所提出的前向-后向算法收敛至TERMDP的驻点,且每个极限点均满足推导出的最优性条件。
  • 该算法是Arimoto-Blahut算法在率失真问题中的推广,适用于传递熵最小化。
  • 必要最优性条件被表示为一组涉及条件概率与拉格朗日乘子的有限非线性方程。
  • 通过引入保持最优性的投影算子 π,建立了算法的收敛性。
  • 在迷宫导航任务中,随着信息成本增加,策略趋于更简单、状态依赖性更低,表明决策行为发生定性转变。
  • 该框架为先前使用互信息或KL散度作为代价函数的模型提供了物理解释与信息论基础的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。