Skip to main content
QUICK REVIEW

[论文解读] Smooth Exploration for Robotic Reinforcement Learning

Antonin Raffin, Jens Kober|elib (German Aerospace Center)|May 12, 2020
Reinforcement Learning in Robotics参考文献 53被引用 9
一句话总结

本文提出广义状态依赖探索(gSDE),一种用于深度强化学习的平滑探索方法,该方法用在固定间隔采样的状态依赖噪声替代独立的高斯噪声。通过将噪声采样频率与控制频率解耦,gSDE 实现了在真实机器人上直接进行稳定、高性能的策略训练——在肌腱驱动机器人、四足机器人和遥控车平台上得到验证——无需仿真到现实的迁移或额外滤波,性能与非结构化探索相当,同时消除了剧烈抖动运动。

ABSTRACT

Reinforcement learning (RL) enables robots to learn skills from interactions with the real world. In practice, the unstructured step-based exploration used in Deep RL -- often very successful in simulation -- leads to jerky motion patterns on real robots. Consequences of the resulting shaky behavior are poor exploration, or even damage to the robot. We address these issues by adapting state-dependent exploration (SDE) to current Deep RL algorithms. To enable this adaptation, we propose two extensions to the original SDE, using more general features and re-sampling the noise periodically, which leads to a new exploration method generalized state-dependent exploration (gSDE). We evaluate gSDE both in simulation, on PyBullet continuous control tasks, and directly on three different real robots: a tendon-driven elastic robot, a quadruped and an RC car. The noise sampling interval of gSDE permits to have a compromise between performance and smoothness, which allows training directly on the real robots without loss of performance. The code is available at https://github.com/DLR-RM/stable-baselines3.

研究动机与目标

  • 解决真实世界机器人强化学习中因非结构化高斯噪声导致的不稳定性和损坏风险。
  • 将状态依赖探索(SDE)适配至现代深度强化学习算法,以提升平滑性并降低方差。
  • 实现在真实机器人上直接训练,无需仿真到现实的迁移或外部滤波。
  • 通过不同噪声采样间隔评估探索平滑性与学习性能之间的权衡。
  • 在多种真实世界机器人平台上验证该方法,包括肌腱驱动机器人、四足机器人和遥控车。

提出的方法

  • gSDE 用一个状态依赖的噪声函数替代独立同分布的高斯噪声,该函数在不同回合中对相同状态产生一致的动作。
  • 该方法引入在可配置间隔(例如每8步)进行噪声向量的周期性重采样,将探索平滑性与控制频率解耦。
  • 通过神经网络头学习广义的噪声调度,基于当前状态输出探索噪声,初始 log-std 超参数按算法进行调优。
  • 该方法被集成到 SAC、TD3、A2C 和 PPO 等主流深度强化学习算法中,超参数根据算法和环境进行调整。
  • 探索噪声直接应用于策略输出,保留底层强化学习算法的结构,同时增强轨迹平滑性。
  • 通过将平滑性直接嵌入探索机制,避免使用外部滤波器或底层控制器。

实验结果

研究问题

  • RQ1状态依赖探索能否有效适配至现代深度强化学习算法,以减少真实机器人上的剧烈抖动?
  • RQ2gSDE 中噪声重采样的频率如何影响探索平滑性与学习性能之间的权衡?
  • RQ3gSDE 能否实现在真实机器人上直接、稳定地训练深度强化学习策略,而无需仿真到现实的迁移或额外滤波?
  • RQ4gSDE 是否在显著提升运动平滑性的同时,保持与非结构化高斯探索相当的学习性能?
  • RQ5gSDE 在具有不同动力学特性和执行器约束的多样化真实机器人平台上表现如何?

主要发现

  • gSDE 实现了在真实机器人上直接训练深度强化学习策略的成功,包括肌腱驱动机器人、四足机器人和遥控车,无需仿真到现实的迁移或外部滤波。
  • 该方法在最终回报方面与非结构化探索性能相当,同时消除了基线方法中观察到的剧烈抖动运动模式。
  • 在 PyBullet 环境中,8 步的噪声采样间隔在平滑性与性能之间提供了良好平衡,更高的间隔可降低方差并提升稳定性。
  • 在真实肌腱驱动机器人 David 上,非结构化探索因不稳定性与电机磨损而失败,而 gSDE 实现了稳定且成功的训练。
  • gSDE 降低了动作轨迹随时间的方差,因为状态依赖噪声在不同回合中对同一状态产生一致的扰动。
  • 该方法成功集成到 SAC、TD3、A2C 和 PPO 中,证明了其与最先进深度强化学习算法的广泛兼容性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。