[论文解读] Learning Navigation Behaviors End-to-End with AutoRL
该论文提出AutoRL,一种自动强化学习框架,联合优化奖励函数设计与神经网络架构,用于端到端导航策略。在小型静态环境中进行仿真训练后,所得的点对点与路径跟随策略在大型、未见过的真实世界环境中分别实现了比基线高23%和26%的成功率,展现出对噪声和动态障碍物的鲁棒性。
We learn end-to-end point-to-point and path-following navigation behaviors that avoid moving obstacles. These policies receive noisy lidar observations and output robot linear and angular velocities. The policies are trained in small, static environments with AutoRL, an evolutionary automation layer around Reinforcement Learning (RL) that searches for a deep RL reward and neural network architecture with large-scale hyper-parameter optimization. AutoRL first finds a reward that maximizes task completion, and then finds a neural network architecture that maximizes the cumulative of the found reward. Empirical evaluations, both in simulation and on-robot, show that AutoRL policies do not suffer from the catastrophic forgetfulness that plagues many other deep reinforcement learning algorithms, generalize to new environments and moving obstacles, are robust to sensor, actuator, and localization noise, and can serve as robust building blocks for larger navigation tasks. Our path-following and point-to-point policies are respectively 23% and 26% more successful than comparison methods across new environments. Video at: https://youtu.be/0UwkjpUEcbI
研究动机与目标
- 开发一种可扩展的自动化方法,用于训练能够跨多样化环境和传感器噪声水平泛化的端到端导航策略。
- 通过自动化奖励函数与网络架构搜索,解决深度强化学习在机器人导航中稀疏奖励与泛化能力差的挑战。
- 构建对传感器、执行器和定位噪声具有鲁棒性的导航策略,并能有效从仿真迁移至真实世界部署。
- 实现无需显式障碍物速度信息或复杂运动规划堆栈的静态与动态障碍物避让策略。
- 通过用自动化的大规模超参数优化替代专家设计的奖励函数与网络架构,减少人工超参数调优。
提出的方法
- AutoRL使用无梯度、基于进化的大规模超参数优化(如CMA-ES),并行搜索奖励函数与神经网络架构。
- 该方法首先优化一个能最大化仿真环境中任务完成度的奖励函数,随后固定该奖励函数,搜索最优神经网络架构。
- 策略采用深度强化学习(DDPG)进行训练,输入为激光雷达观测,输出为速度控制,运行频率为5 Hz。
- 奖励函数通过可学习系数参数化,包含到目标距离、与障碍物的间隙以及路径偏离度等项。
- 神经网络架构由各层宽度定义(如P2P任务为[50, 20, 10]),AutoRL在这些超参数范围内搜索以最大化累积回报。
- 训练过程中注入噪声以模拟真实世界条件:传感器噪声(σ_Lidar = 0.3 m)、执行器噪声(σ_Speed = 0.1 m/s,σ_Turning = 0.1 rad/s)以及定位噪声(σ_Localize = 0.1 m)。
实验结果
研究问题
- RQ1自动化方法能否联合优化奖励函数设计与神经网络架构,以提升端到端导航策略的泛化能力?
- RQ2AutoRL训练的策略在包含动态障碍物与传感器噪声的大规模、此前未见过的环境中,其泛化能力达到何种程度?
- RQ3在仿真与真实机器人部署中,AutoRL与人工调优的基线方法(如DWA、APF、BC)相比,在成功率与鲁棒性方面表现如何?
- RQ4AutoRL策略能否避免灾难性遗忘,并在不同噪声水平与环境复杂度下保持性能?
- RQ5在存在移动障碍物的路径跟随任务中,使用PRM生成的路径引导点是否能提升性能?
主要发现
- 在三个大型、未见过的真实世界环境中,AutoRL策略在点对点导航任务中实现了26%更高的成功率,在路径跟随任务中实现了23%更高的成功率,优于基线方法。
- 策略在训练环境大小6.8至30.1倍大的环境中实现了鲁棒泛化,且无需微调。
- 在真实世界的Fetch机器人上,策略成功导航超过80米路径,在动态环境中实现无碰撞障碍物避让。
- 策略对传感器、执行器和定位噪声表现出鲁棒性,在高噪声水平下性能未下降。
- 在仿真与真实世界评估中,AutoRL策略均优于人工调优的DDPG、APF、DWA与行为克隆基线方法。
- 该方法成功避免了灾难性遗忘,在多样化的训练与评估条件下均保持高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。