[论文解读] Value function approximation via low-rank models
该论文提出了一种基于低秩与稀疏矩阵分解的值函数逼近方法,用于马尔可夫决策过程(MDPs),利用鲁棒主成分分析(RPCA)通过主成分追踪(PCP)恢复真实值函数。在测试的MDPs中,该方法仅使用原始矩阵大小的2%以下,即实现了近乎完美的逼近,同时保持了最优策略的性能。
We propose a novel value function approximation technique for Markov decision processes. We consider the problem of compactly representing the state-action value function using a low-rank and sparse matrix model. The problem is to decompose a matrix that encodes the true value function into low-rank and sparse components, and we achieve this using Robust Principal Component Analysis (PCA). Under minimal assumptions, this Robust PCA problem can be solved exactly via the Principal Component Pursuit convex optimization problem. We experiment the procedure on several examples and demonstrate that our method yields approximations essentially identical to the true function.
研究动机与目标
- 通过利用状态-动作值函数的低内在维度性,解决大规模MDPs中的维度灾难问题。
- 开发一种紧凑的状态-动作值函数表示方法,以保持最优策略的性能。
- 应用鲁棒PCA将值函数矩阵分解为低秩与稀疏分量,实现高效逼近。
- 验证低秩加稀疏模型在连续MDPs中实现的性能与最优策略无差异。
提出的方法
- 将状态-动作值函数建模为矩阵 M ∈ ℝ^{m×n},编码所有状态-动作对的值。
- 将 M 建模为低秩分量 L₀ 与稀疏分量 S₀ 的叠加:M = L₀ + S₀。
- 通过凸优化求解PCP分解:最小化 ‖L‖⁎ + λ‖S‖₁,约束条件为 L + S = M。
- 利用核范数(‖·‖⁎)作为低秩结构的凸近似,利用 ℓ¹-范数(‖·‖₁)促进 S 中的稀疏性。
- 使用交替方向乘子法(ADMM)算法求解PCP问题,通过MATLAB与C语言的MEX接口实现。
- 通过结合低秩逼近(基于 L 的SVD)与稀疏校正(S)重建策略,实现实时高效查表。
实验结果
研究问题
- RQ1低秩与稀疏矩阵分解能否在连续MDPs中有效逼近状态-动作值函数?
- RQ2与完整值函数相比,低秩加稀疏模型在多大程度上保持了最优策略性能?
- RQ3在值函数逼近中,不造成显著性能损失的情况下,可实现多大程度的内存压缩?
- RQ4在具有结构化噪声或异常值的MDPs中,鲁棒PCA是否是值函数逼近的一种可行且准确的方法?
主要发现
- 在Mountain Car任务中,低秩加稀疏模型实现了54.461秒的到达目标时间,与最优策略完全一致。
- 在倒立摆任务中,平均偏离直立位置的距离为0.442,仅略差于最优值0.441。
- 该方法在Mountain Car中仅需4.887×10⁴个非零条目(占原始大小的4.887%),在倒立摆中仅需3.136×10⁵个非零条目(占原始大小的12.5%),分别实现原始矩阵大小的2%以下与13%以下。
- 对策略热力图的视觉检查显示,原始模型与低秩加稀疏模型之间差异可忽略,尤其在倒立摆任务中更为明显。
- 基于PCP的分解成功恢复了真实值函数结构,即使在稀疏分量具有大数值条目且支持集未知的情况下,误差也极小。
- 该方法在连续MDPs中具有良好泛化能力,表明具有低内在维度的值函数可使用低秩与稀疏模型实现紧凑表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。