[论文解读] A Deep Reinforcement Learning Approach for Dynamically Stable Inverse Kinematics of Humanoid Robots
本文提出一种基于深度强化学习(DRL)的方法,采用深度确定性策略梯度(DDPG)求解具有动态稳定性的仿人机器人逆运动学问题。该方法学习关节空间轨迹,以在抓取任务中保持平衡,即使在涉及关节式躯干的复杂姿态下,也能实现90%的末端执行器定位精度,同时确保零力矩点(ZMP)位于支撑多边形内。
Real time calculation of inverse kinematics (IK) with dynamically stable configuration is of high necessity in humanoid robots as they are highly susceptible to lose balance. This paper proposes a methodology to generate joint-space trajectories of stable configurations for solving inverse kinematics using Deep Reinforcement Learning (RL). Our approach is based on the idea of exploring the entire configuration space of the robot and learning the best possible solutions using Deep Deterministic Policy Gradient (DDPG). The proposed strategy was evaluated on the highly articulated upper body of a humanoid model with 27 degree of freedom (DoF). The trained model was able to solve inverse kinematics for the end effectors with 90% accuracy while maintaining the balance in double support phase.
研究动机与目标
- 解决在高度冗余的仿人机器人中,具有动态稳定约束条件下的实时逆运动学(IK)挑战。
- 学习在任务执行期间保持平衡的稳定、无碰撞的关节构型,特别是在双支撑阶段。
- 克服传统数值IK求解器的局限性,如病态矩阵求逆和收敛不一致的问题。
- 利用深度强化学习,在复杂、高自由度构型下实现稳定性与自碰撞避免的泛化能力。
- 在具有关节式躯干的27自由度仿人机器人模型上验证该方法,以实现类人运动生成。
提出的方法
- 使用深度确定性策略梯度(DDPG)学习用于关节构型生成的连续动作策略。
- 定义一个奖励函数,综合考虑末端执行器位置误差、ZMP稳定性以及自碰撞惩罚。
- 采用具有优先经验回放的回放缓冲区,以稳定训练并提高样本效率。
- 使用独立的演员和评论家神经网络,分别近似策略和动作价值函数。
- 在训练过程中引入探索噪声(Ornstein-Uhlenbeck),以促进在连续动作空间中的策略探索。
- 在模拟环境中训练智能体,使用具有躯干活动特性的27自由度仿人机器人模型,以增强灵巧性。
实验结果
研究问题
- RQ1基于DRL的方法是否能够在不依赖解析或数值求解器的情况下,学习到27自由度仿人机器人的稳定逆运动学解?
- RQ2DDPG在复杂抓取任务中,能否有效学习到使ZMP始终保持在支撑多边形内的策略?
- RQ3关节式躯干在多大程度上提升了所学姿态的可行性与类人特征?
- RQ4训练后的策略是否能在多样化的目标位置上实现泛化,同时避免自碰撞和不稳定性?
- RQ5与传统数值方法相比,基于DRL的IK求解器在收敛性和稳定性方面表现如何?
主要发现
- 基于DDPG的IK求解器在9900次训练样本中实现了90%的平均精度,100次随机测试样本中最高达到93%的精度。
- 归一化的Q值和奖励曲线在约30,000个训练周期后趋于饱和,表明已收敛至最优策略。
- 在所有三个模拟任务中,ZMP始终位于支撑多边形内,证实了在复杂机动过程中的动态稳定性。
- 关节式躯干使类人姿态成为可能,例如通过躯干弯曲和旋转实现向远侧右方或左后方的抓取。
- 该模型表现出鲁棒性,在高风险构型(如低于膝盖位置抓取)下仍能保持平衡并避免自碰撞。
- 在大多数测试案例中,该求解器的收敛速度优于传统数值方法,尤其在高冗余场景下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。