[论文解读] DOB-Net: Actively Rejecting Unknown Excessive Time-Varying Disturbances
DOB-Net 是一种强化学习框架,将基于循环神经网络(RNN)的扰动观测器与控制器相结合,以主动抑制机器人系统中未知、时变且过大的扰动。通过在 RNN 隐藏状态中编码过去扰动并预测未来扰动,该方法在执行器受限条件下实现最优控制,在模拟和真实水下扰动数据测试中显著优于传统反馈控制器和经典强化学习算法。
This paper presents an observer-integrated Reinforcement Learning (RL) approach, called Disturbance OBserver Network (DOB-Net), for robots operating in environments where disturbances are unknown and time-varying, and may frequently exceed robot control capabilities. The DOB-Net integrates a disturbance dynamics observer network and a controller network. Originated from conventional DOB mechanisms, the observer is built and enhanced via Recurrent Neural Networks (RNNs), encoding estimation of past values and prediction of future values of unknown disturbances in RNN hidden state. Such encoding allows the controller generate optimal control signals to actively reject disturbances, under the constraints of robot control capabilities. The observer and the controller are jointly learned within policy optimization by advantage actor critic. Numerical simulations on position regulation tasks have demonstrated that the proposed DOB-Net significantly outperforms a conventional feedback controller and classical RL algorithms.
研究动机与目标
- 解决在未知、过量且时变扰动超过控制能力时对机器人进行控制的挑战。
- 克服传统基于扰动观测器的控制(DOBC)方法的局限性,后者依赖精确的系统模型,且忽略时间相关性与控制约束。
- 开发一种集成学习框架,联合优化扰动估计与控制策略,以提升鲁棒性与性能。
- 通过 RNN 实现预测性扰动编码,实现主动扰动抑制,增强对快速变化扰动的适应能力。
- 在模拟扰动与从水箱中 AUV 收集的真实世界扰动数据上验证该方法。
提出的方法
- DOB-Net 通过优势演员-critic 策略优化方法,端到端联合训练扰动动力学观测网络与控制器网络。
- 观测网络使用循环神经网络(RNN)在其隐藏状态中编码历史扰动值并预测未来扰动,模仿并增强传统 DOB 机制。
- 基于 RNN 的观测器无需精确的系统模型即可估计并预测扰动,提升了对模型不确定性的鲁棒性。
- 控制器网络结合当前机器人状态与 RNN 编码的扰动预测作为输入,生成控制信号。
- 观测器与控制器的联合学习实现了对扰动动力学的优化表征,避免了对人工设计特征的依赖。
- 训练使用由多个正弦波组成的模拟扰动;测试在模拟扰动与从 AUV 惯性测量单元(IMU)收集的真实世界扰动上进行。
实验结果
研究问题
- RQ1RNN 增强的观测网络是否能提升机器人在面对过量、时变扰动时的扰动估计与预测能力?
- RQ2通过强化学习联合训练观测器与控制器,是否能实现比经典反馈控制或独立强化学习方法更好的扰动抑制效果?
- RQ3DOB-Net 在训练期间未见过的真实世界复杂多样的扰动上表现如何?
- RQ4当扰动超过执行器能力时,该方法在控制约束下是否仍能保持性能?
- RQ5在有限训练数据下,该框架是否能泛化到具有更宽幅值范围的未见扰动模式?
主要发现
- 在大扰动模拟条件下,DOB-Net 实现了与目标距离的中位数为 0.493m,收敛区域显著缩小,优于传统控制器与经典强化学习算法。
- 在大扰动模拟条件下,DOB-Net 与最优轨迹的中位数距离比值为 186.65%,表明其性能接近理论最优值。
- 在真实世界收集的扰动上,DOB-Net 的中位数距离为最优值的 264.88%,表明真实数据中更高复杂度与多样性导致性能差距。
- 尽管真实数据上存在性能差距,DOB-Net 仍优于所有基线方法,包括 RISE 与 DOBC,证明了其在真实场景中的实际有效性。
- 更大的扰动幅值使最优控制模式更加相似,使强化学习更容易学习近似最优策略,从而提升了相对性能。
- 由于 RNN 能够在隐藏状态中编码时间动态,该方法对模型不确定性与快速变化的扰动表现出鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。