QUICK REVIEW
[论文解读] Boosting for Control of Dynamical Systems
Naman Agarwal, Nataly Brukhim|arXiv (Cornell University)|Jun 20, 2019
Game Theory and Applications被引用 5
一句话总结
本文提出了一种用于动态系统在线控制的提升框架,能够高效聚合弱控制器,形成性能更强、且性能可证明更优的控制器。通过结合带记忆的在线学习与基于梯度的提升方法,该方法实现了与弱控制器凸组合相当的遗憾边界,在实验中优于单个弱学习器以及过参数化的模型。
ABSTRACT
We study the question of how to aggregate controllers for dynamical systems in order to improve their performance. To this end, we propose a framework of boosting for online control. Our main result is an efficient boosting algorithm that combines weak controllers into a provably more accurate one. Empirical evaluation on a host of control settings supports our theoretical findings.
研究动机与目标
- 解决在难以设计强控制器但可轻松获得弱控制器的动态系统中提升控制器性能的挑战。
- 在具有状态依赖动力学和对抗性扰动的在线非随机控制背景下,形式化提升方法。
- 开发高效算法,将弱控制器组合为强控制器,并提供理论性能保证。
- 通过实证结果证明,提升小型控制器的性能优于在控制任务中训练大型过参数化控制器。
提出的方法
- 提出一种在具有状态的动态系统中用于在线控制的提升框架,采用非随机、对抗性设置,其中代价和扰动随时间逐步揭示。
- 利用在线学习带记忆和在线梯度提升的技术,设计一种算法,可维持一系列遗憾有界的控制器。
- 引入记忆有界性假设(H-有界记忆),以确保过去动作在H步之后的影响可忽略,从而实现理论保证。
- 设计两种提升算法:一种与弱控制器的凸包竞争,另一种使二次损失弱控制器能够处理一般光滑强凸损失。
- 采用一种提升循环,根据弱控制器的历史表现迭代地重新加权和组合,以最小化累积遗憾。
- 将该框架应用于线性和非线性系统,包括LQR、高斯随机游走、正弦扰动以及倒立摆设置。
实验结果
研究问题
- RQ1能否将提升方法正式扩展到具有状态和对抗性扰动的动态系统在线控制中?
- RQ2如何将性能有限的弱控制器组合,以在控制任务中实现强性能保证?
- RQ3在数据有限的控制任务中,提升方法是否优于过参数化的深度学习模型?
- RQ4能否通过提升过程将为二次损失设计的弱控制器适配以处理更一般的光滑强凸损失函数?
- RQ5记忆结构(如有界记忆)对控制中提升方法的理论和实证性能有何影响?
主要发现
- 所提出的提升算法实现了与最佳弱控制器凸组合相当的遗憾性能,提供了性能改进的理论保证。
- 在具有i.i.d.噪声的线性动态系统中,提升后的控制器性能接近已知最优线性二次调节器(LQR)的性能。
- 对于相关扰动(如高斯随机游走和正弦扰动),提升后的控制器始终优于其单个弱控制器,包括GPC和基于RNN的基线模型。
- 在具有非线性动力学和相关噪声的倒立摆任务中,提升后的控制器成功稳定了系统,优于所有弱基线模型以及一个过参数化的RNN。
- 实证结果表明,通过提升小型简单控制器可获得优于使用相同参数数量训练大型过参数化RNN的性能,表明优势源于提升机制而非模型规模。
- 该框架使基于二次损失的弱控制器能够通过提升过程有效应对更一般的光滑强凸损失函数。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。