[论文解读] Aggressive Quadrotor Flight Using Curiosity-Driven Reinforcement Learning
该论文提出了一种基于相似性好奇心模块和分支结构探索(BSE)的好奇心驱动深度强化学习方法,实现了无需预设轨迹的端到端高速无人直升机飞行。该方法加速了训练过程,提升了策略鲁棒性,并在模拟与真实世界实验中均表现出优异的仿真到现实的迁移能力,优于基线强化学习方法和基于轨迹规划的方法,在绕桩和窄窗飞行任务中表现更优。
The ability to perform aggressive movements, which are called aggressive flights, is important for quadrotors during navigation. However, aggressive quadrotor flights are still a great challenge to practical applications. The existing solutions to aggressive flights heavily rely on a predefined trajectory, which is a time-consuming preprocessing step. To avoid such path planning, we propose a curiosity-driven reinforcement learning method for aggressive flight missions and a similarity-based curiosity module is introduced to speed up the training procedure. A branch structure exploration (BSE) strategy is also applied to guarantee the robustness of the policy and to ensure the policy trained in simulations can be performed in real-world experiments directly. The experimental results in simulations demonstrate that our reinforcement learning algorithm performs well in aggressive flight tasks, speeds up the convergence process and improves the robustness of the policy. Besides, our algorithm shows a satisfactory simulated to real transferability and performs well in real-world experiments.
研究动机与目标
- 消除高速无人直升机飞行任务中耗时的轨迹规划需求。
- 解决欠驱动、高速无人直升机控制中强化学习的稀疏奖励问题。
- 通过基于相似性的好奇心模块提升训练效率和策略鲁棒性。
- 利用分支结构探索(BSE)策略增强仿真到现实的迁移能力。
- 实现仿真训练策略在真实世界高速飞行任务中的直接部署。
提出的方法
- 基于相似性的好奇心模块根据状态(位置和速度)的相似性计算内在奖励,以在稀疏奖励环境中促进探索。
- 将好奇心模块与TD3算法结合,形成好奇心驱动的TD3智能体,用于端到端控制策略学习。
- BSE(分支结构探索)策略通过支持多个动作分支,丰富了训练多样性,提升了策略的泛化能力和鲁棒性。
- 训练过程中随机采样具有不同位置和姿态的障碍物,以增强环境适应能力。
- 策略仅在仿真环境中训练,并直接部署于真实世界实验,无需微调。
- 状态观测包括无人直升机的位置、速度和障碍物几何信息,支持实时决策。
实验结果
研究问题
- RQ1基于好奇心的强化学习方法是否能有效训练出无需预设轨迹的高速无人直升机飞行策略?
- RQ2基于相似性的好奇心模块在稀疏奖励的高速飞行任务中如何提升样本效率和收敛速度?
- RQ3BSE策略在多大程度上增强了训练策略的鲁棒性和仿真到现实的迁移能力?
- RQ4与基于轨迹规划的方法和标准强化学习基线相比,所提方法在性能和迁移能力方面表现如何?
- RQ5在仿真环境中训练的策略是否可直接部署于真实无人直升机上执行高速飞行任务?
主要发现
- 在绕桩路径任务中,本方法实现了0.044的平均位置误差和2.06°的平均旋转误差,优于非线性跟踪控制器(0.057和3.17°)和TD3基线(0.456和5.31°)。
- 在窄窗任务中,本方法实现了0.187 m的位置误差和6.02°的旋转误差,显著优于TD3基线(0.431 m和8.81°)。
- 仿真与真实环境之间的位置差异为0.12 m,角度差异为3.8°,表明尽管存在仿真与真实环境的差距,仍具备强大的迁移能力。
- 好奇心与BSE的结合使仿真到真实轨迹差异减少了30%,表明策略鲁棒性得到提升。
- 消融实验表明,好奇心和BSE均能独立提升性能与迁移能力,完整方法取得了最佳效果。
- 在仿真中训练的策略成功在真实世界环境中执行了高速飞行任务而无需重新训练,验证了直接仿真到真实部署的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。