[论文解读] Learning Extreme Hummingbird Maneuvers on Flapping Wing Robots
本文提出一种混合控制策略,使一只重12克的扑翼蜂鸟机器人能够执行与真实蜂鸟相似的极端规避机动,通过无模型强化学习策略使飞行器失稳并进行剧烈机动,仅用20个翅膀拍打周期即完成180°偏航转动和向后平移——略低于真实生物对手的两倍时间,展示了仅使用两个执行器的从仿真到现实的成功迁移。
Biological studies show that hummingbirds can perform extreme aerobatic maneuvers during fast escape. Given a sudden looming visual stimulus at hover, a hummingbird initiates a fast backward translation coupled with a 180-degree yaw turn, which is followed by instant posture stabilization in just under 10 wingbeats. Consider the wingbeat frequency of 40Hz, this aggressive maneuver is carried out in just 0.2 seconds. Inspired by the hummingbirds' near-maximal performance during such extreme maneuvers, we developed a flight control strategy and experimentally demonstrated that such maneuverability can be achieved by an at-scale 12-gram hummingbird robot equipped with just two actuators. The proposed hybrid control policy combines model-based nonlinear control with model-free reinforcement learning. We use model-based nonlinear control for nominal flight control, as the dynamic model is relatively accurate for these conditions. However, during extreme maneuver, the modeling error becomes unmanageable. A model-free reinforcement learning policy trained in simulation was optimized to 'destabilize' the system and maximize the performance during maneuvering. The hybrid policy manifests a maneuver that is close to that observed in hummingbirds. Direct simulation-to-real transfer is achieved, demonstrating the hummingbird-like fast evasive maneuvers on the at-scale hummingbird robot.
研究动机与目标
- 复制华丽蜂鸟的极端规避机动,该机动在10个翅膀拍打周期内(40Hz时约0.2秒)完成180°偏航转动和向后平移。
- 为仅配备两个执行器的扑翼微型飞行器(FWMAV)开发一种飞行控制策略,使其在严重欠驱动条件下仍能实现高敏捷性机动。
- 通过模仿蜂鸟所展现的动态失稳和快速控制调制,弥合仿生机器人与自然飞行器之间的性能差距。
- 实现强化学习策略的直接仿真到现实迁移,用于剧烈机动控制,克服极端飞行状态下的建模误差。
提出的方法
- 混合控制策略结合基于模型的非线性控制器以实现稳定悬停和常规飞行,以及无模型强化学习策略以实现极端机动。
- 强化学习策略在仿真环境中训练,旨在有意使系统失稳,并在快速规避机动中最大化性能。
- 两个控制器的输出相加,类似于结构化控制网络,仅机动策略部分被学习。
- 系统使用动力学模型实现稳定飞行,但在高加速度机动导致建模误差不可控时,切换至基于学习的控制。
- 通过两个独立执行器实时调节机器人的翅膀运动,以在所有三个轴向上产生升力和控制力矩。
- 控制策略被优化以复现蜂鸟观察到的三阶段逃逸模式:初始向后平移并抬头,偏航转动,以及恢复至悬停。
实验结果
研究问题
- RQ1仅配备两个执行器的扑翼机器人能否在10个翅膀拍打周期内完成蜂鸟的极端规避机动(即180°偏航转动和向后平移)?
- RQ2结合基于模型与无模型方法的混合控制策略,如何在严重欠驱动系统中实现稳定飞行与剧烈机动?
- RQ3在无需微调的情况下,仿真中训练的强化学习策略在现实飞行中成功迁移的程度如何?
- RQ4蜂鸟与机器人在控制动力学方面存在哪些关键差异,特别是在偏航力矩生成和推力矢量控制方面?
- RQ5在机动持续时间、轨迹和机体运动学方面,机器人的性能与生物基准相比如何进行定量比较?
主要发现
- 机器人在20个翅膀拍打周期内完成180°偏航转动和向后平移,而真实蜂鸟仅用10个周期,表明其机动性极高但略慢于生物对手。
- 机器人的规避机动遵循与蜂鸟相同的三阶段模式:初始向后平移并抬头,偏航旋转,恢复至悬停。
- 尽管仅有两个执行器,机器人在仿真和实验中均实现了与蜂鸟高度接近的机体运动学特征,如图5所示。
- 由于物理配平条件,机器人在机动过程中产生净负偏航力矩,需在整个过程中持续施加偏航输入,而蜂鸟仅用四个翅膀拍打周期即完成转向。
- 仿真到现实的迁移成功,实验数据与仿真轨迹高度吻合,验证了强化学习策略的鲁棒性。
- 机器人能够产生强横滚和俯仰力矩,使其在完成偏航转动后重新将机体朝上,从而补偿了偏航控制的薄弱。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。