[论文解读] Robust exploration in linear quadratic reinforcement learning
本文提出了一种基于凸优化的方法,用于线性二次控制问题中的鲁棒强化学习,通过平衡利用与目标探索,最小化模型不确定性下的最坏情况成本。该方法动态激励系统,以减少最关键参数的不确定性,在仿真和软硬件协同实验中均展现出优于基线方法的鲁棒性与性能。
This paper concerns the problem of learning control policies for an unknown linear dynamical system to minimize a quadratic cost function. We present a method, based on convex optimization, that accomplishes this task robustly: i.e., we minimize the worst-case cost, accounting for system uncertainty given the observed data. The method balances exploitation and exploration, exciting the system in such a way so as to reduce uncertainty in the model parameters to which the worst-case cost is most sensitive. Numerical simulations and application to a hardware-in-the-loop servo-mechanism demonstrate the approach, with appreciable performance and robustness gains over alternative methods observed in both.
研究动机与目标
- 解决未知线性动态系统在二次成本下的探索-利用权衡问题。
- 通过最小化基于观测数据推导的模型不确定性下的最坏情况成本,确保鲁棒性能。
- 设计有针对性的探索策略,仅减少对最坏情况成本影响最大的参数的不确定性。
- 开发一种计算上可行的凸近似方法,用于鲁棒LQR,以实现高效的策略合成。
- 在数值仿真和软硬件协同实验中验证该方法,证明其在性能与鲁棒性方面的改进。
提出的方法
- 推导系统参数估计误差谱范数的高概率界,实现对鲁棒控制中不确定性的量化。
- 提出一种半定规划(SDP)凸近似方法,用于在参数不确定性下求解最坏情况无限时域LQR问题。
- 将不确定性界与凸LQR近似整合进一种鲁棒强化学习(RRL)框架,以平衡探索与利用。
- 采用前瞻时域 h=10(仿真)或 h=5(硬件)来基于未来最坏情况成本敏感度指导策略更新。
- 自适应优化探索方差,以减少最关键模型参数的不确定性,避免任意或随机探测。
- 采用名义鲁棒策略作为基线,并与一种贪婪探索策略进行对比,后者通过增加方差以匹配理论最坏情况成本。
实验结果
研究问题
- RQ1如何系统性地有针对性地探索,以减少对最坏情况控制性能影响最大的参数的不确定性?
- RQ2能否使用凸优化框架以可计算的方式近似模型不确定性下的最坏情况LQR问题?
- RQ3结合目标探索与最坏情况成本最小化的鲁棒强化学习,是否优于纯粹利用或随机探索的策略?
- RQ4该方法在真实世界软硬件协同控制场景中,能在多大程度上提升鲁棒性与性能?
- RQ5尽管总体不确定性减少程度较低,该方法的信息增益(不确定性减少)与贪婪探索相比如何?
主要发现
- 在数值仿真中,所提出的RRL方法在总成本上均低于名义策略(纯利用)和贪婪策略(随机探索)。
- 在初始阶段,由于缺乏探索,名义策略表现更优,但RRL在后续阶段超越了它,展现出有效的长期学习能力。
- RRL比贪婪探索更具有策略性地减少不确定性,其信息增益高于名义策略但低于贪婪策略,然而在成本表现上仍优于两者。
- 在软硬件协同实验中,RRL在总成本和每轮成本上均显著优于两种基线方法。
- 即使在使用理论最坏情况行为更新模型不确定性时,该方法仍能实现鲁棒性能,证实其最坏情况优化目标的有效性。
- 信息度量(1/λ_max(D_i^{-1})) 表明,RRL以与成本降低直接相关的方式减少不确定性,表明其学习具有针对性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。