[论文解读] Hierarchical Decomposition of Nonlinear Dynamics and Control for System Identification and Policy Distillation
本文提出了一种基于期望最大化算法的分层分解框架,利用随机切换线性动态系统(SLS)对非线性动力学与控制进行建模。通过将复杂系统建模为一组局部线性、马尔可夫性控制器的混合,该方法实现了可解释的系统辨识与策略蒸馏,在摆动提升与稳定任务中成功率超过95%,且相比深度神经网络,策略复杂度显著降低。
The control of nonlinear dynamical systems remains a major challenge for autonomous agents. Current trends in reinforcement learning (RL) focus on complex representations of dynamics and policies, which have yielded impressive results in solving a variety of hard control tasks. However, this new sophistication and extremely over-parameterized models have come with the cost of an overall reduction in our ability to interpret the resulting policies. In this paper, we take inspiration from the control community and apply the principles of hybrid switching systems in order to break down complex dynamics into simpler components. We exploit the rich representational power of probabilistic graphical models and derive an expectation-maximization (EM) algorithm for learning a sequence model to capture the temporal structure of the data and automatically decompose nonlinear dynamics into stochastic switching linear dynamical systems. Moreover, we show how this framework of switching models enables extracting hierarchies of Markovian and auto-regressive locally linear controllers from nonlinear experts in an imitation learning scenario.
研究动机与目标
- 为解决现代深度强化学习策略缺乏可解释性的问题,通过将复杂非线性动力学分解为更简单的局部线性分量。
- 开发一种基于演示数据的、用于从概率图模型中识别混合动力学与控制策略的数据驱动方法。
- 通过从过参数化的专家(如深度强化学习智能体)中提取紧凑、自回归、局部线性控制器,实现策略蒸馏。
- 证明即使数据有限,局部线性模型也能有效捕捉长时域非线性动力学。
- 将框架扩展以支持内生输入,用于模仿学习,实现将复杂策略压缩为可解释的切换控制器。
提出的方法
- 该框架将非线性动力学建模为循环自回归隐马尔可夫模型(rAR-HMM),一种具有离散切换状态的混合动态贝叶斯网络(HDBN)。
- 推导出一种期望最大化(EM)算法,联合推断切换线性动态系统的参数,包括转移概率、状态动力学和观测模型。
- 通过引入来自策略网络的内生输入,该方法支持开环系统辨识与闭环控制学习。
- 采用消息传递与变分推理处理潜在离散状态,从而实现从时间序列数据中高效学习切换结构。
- 该框架支持马尔可夫性与自回归的局部线性控制器,支持分层策略表示。
- 通过训练rAR-HMM以模仿专家演示,实现策略蒸馏,从而获得紧凑、可解释的混合策略。
实验结果
研究问题
- RQ1具有切换动力学的概率图模型能否有效从有限的时间序列数据中识别复杂非线性动力学?
- RQ2将非线性控制策略分层分解为局部线性控制器,在降低模型复杂度的同时,能否有效保持任务性能?
- RQ3rAR-HMM框架中的内生输入在多大程度上能实现从专家策略中有效模仿学习?
- RQ4所提出的基于EM的推理方法能否在无先验知识的情况下自动发现状态-动作空间中有意义的切换区域?
- RQ5在经典控制基准任务中,混合框架中使用局部线性控制器是否能优于或至少匹配深度神经网络策略的性能?
主要发现
- rAR-HMM框架在摆动提升与稳定摆杆与小车间环境的任务中,使用蒸馏后的混合策略,成功率超过95%。
- 该方法成功地将非线性动力学分解为可解释的局部线性分量,且通过自回归结构捕捉了长时域依赖关系。
- 策略蒸馏将参数数量从4,545(SAC智能体)减少至5个模式,混合策略中仅含50个参数,同时保持了相当的性能。
- EM算法有效学习了切换结构与动力学参数,即使在数据有限的情况下也能实现精确的系统辨识。
- 该框架证明了局部线性控制器能够有效表示经典控制任务中的复杂非线性行为。
- 引入内生输入实现了有效的模仿学习,使模型能够从演示中恢复专家行为。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。